
slime
把大模型强化学习后训练做成可横向扩展的基础设施
slime 是一个面向大语言模型后训练(post-training)的强化学习框架,核心目标是让 RL 训练能够规模化扩展。它解决的是当前 LLM 强化学习训练中工程复杂、吞吐低、难以横向扩展的问题,把 RLHF/RLVR 等后训练流程做成可复用的训练基础设施。框架提供训练与推理解耦的架构,支持大规模并行采样与高效梯度更新,兼容主流模型与分布式训练后端,让研究者能专注于算法本身而非工程细节。它适合需要跑大规模 RL 后训练、追求吞吐与稳定性的团队,在开源社区中属于成长较快的新兴项目。
项目数据
使用教程
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
环境要求
- Python 环境(项目开发语言为 Python)
- 需准备 Megatron 训练侧环境
- 需准备 SGLang 推理/rollout 侧环境
- 按官方 Quick Start 文档完成环境准备与数据准备
安装与启动步骤
-
1克隆代码仓库
从 GitHub 拉取 slime 源码到本地,后续所有文档与示例都在仓库目录内。
git clone https://github.com/THUDM/slime.git -
2阅读快速开始
README 未直接给出安装命令,环境搭建、数据准备、训练启动均以官方 Quick Start 文档为准。
-
3查看示例用例
examples 目录提供快速开始未覆盖的使用案例,可按自己的训练场景参考。
-
4运行代码风格检查
README 给出的唯一可执行命令,提交前运行以保证代码风格一致。需先安装 pre-commit。
pre-commit run --all-files --show-diff-on-failure --color=always -
5透传引擎原生参数
SGLang 参数加 --sglang- 前缀即可使用;Megatron 参数被 slime 直接读取,无需包装代码。
-
6按需扩展配置
多轮/Agentic 场景可参考 PD 分离、SGLang YAML 配置、外部 rollout 引擎、增量权重同步等文档。
关键配置
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
--sglang-<原生参数> | 否 | 为任意 SGLang 原生参数加前缀后透传给推理引擎 | --sglang-mem-fraction-static 0.8 |
SGLang Config (YAML) | 否 | 可选的 YAML 扩展,用于拓扑控制、异构服务组、按组覆盖等 | 见 docs/en/advanced/sglang-config.md |
如何确认成功
按官方 Quick Start 文档跑通示例训练,能看到 rollout、数据生成与训练流程正常输出即视为成功。
常见问题
Q:README 里为什么没有 pip install 之类的安装命令?
A:README 把环境搭建与训练启动的完整说明放在 docs/en/get_started/quick_start.md,需以该文档为准,本教程不虚构安装命令。
Q:想使用 SGLang 的某个高级参数怎么办?
A:给该参数加 --sglang- 前缀即可,例如把 --mem-fraction-static 写成 --sglang-mem-fraction-static。
Q:Megatron 的并行、优化器、checkpoint 参数怎么传?
A:slime 直接读取 Megatron 参数,无需额外包装代码,原有参数均可用。
Q:多轮对话或 Agentic 场景资源需求不同怎么办?
A:可参考 PD Disaggregation 文档,把 prefill 与 decode 分离部署,并可用 router 策略做会话亲和。
注意事项
- README 未给出具体安装命令,真实安装步骤请以官方 Quick Start 文档为准。
- 推理侧只选用 SGLang 作为单一 rollout 后端,深度优化其 serving、路由、缓存与权重同步能力。
- 生产环境训练/推理解耦、跨不同 GPU 型号部署时,可参考外部 rollout 引擎与从磁盘做全量/增量权重更新。
- 提交代码前请运行 pre-commit 保证风格一致,调试问题可参考 Debugging Guide。
核心亮点
- 训练与推理解耦,支持大规模并行采样,利于 RL 吞吐扩展
- 面向 RL Scaling 设计,适合 RLHF/RLVR 等后训练流程
- Python 实现,与主流分布式训练和推理后端兼容性较好
不足之处
- 项目较新,文档与最佳实践仍在完善中
- 生态与社区案例相对有限,长期维护待观察
适用场景
- 大模型 RLHF 后训练流水线搭建
- RLVR 可验证奖励强化学习训练
- 需要高吞吐采样的大规模 RL 实验
替代项目
OpenRLHF、verl、TRL
项目介绍
下一篇:tunix
同类项目推荐
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···