slime

把大模型强化学习后训练做成可横向扩展的基础设施

slime 是一个面向大语言模型后训练(post-training)的强化学习框架,核心目标是让 RL 训练能够规模化扩展。它解决的是当前 LLM 强化学习训练中工程复杂、吞吐低、难以横向扩展的问题,把 RLHF/RLVR 等后训练流程做成可复用的训练基础设施。框架提供训练与推理解耦的架构,支持大规模并行采样与高效梯度更新,兼容主流模型与分布式训练后端,让研究者能专注于算法本身而非工程细节。它适合需要跑大规模 RL 后训练、追求吞吐与稳定性的团队,在开源社区中属于成长较快的新兴项目。

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 8499
维护状态 活跃
是否开源
定价模式 free

项目数据

分类模型训练
开发团队THUDM
所属国家
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 8499
30天Star增速
HF 下载量
上线时间2025-06-18 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

难度:高级 约 60 分钟 部署方式:本地安装 6 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(项目开发语言为 Python)
  • 需准备 Megatron 训练侧环境
  • 需准备 SGLang 推理/rollout 侧环境
  • 按官方 Quick Start 文档完成环境准备与数据准备

安装与启动步骤

  1. 1克隆代码仓库

    从 GitHub 拉取 slime 源码到本地,后续所有文档与示例都在仓库目录内。

    git clone https://github.com/THUDM/slime.git
  2. 2阅读快速开始

    README 未直接给出安装命令,环境搭建、数据准备、训练启动均以官方 Quick Start 文档为准。

  3. 3查看示例用例

    examples 目录提供快速开始未覆盖的使用案例,可按自己的训练场景参考。

  4. 4运行代码风格检查

    README 给出的唯一可执行命令,提交前运行以保证代码风格一致。需先安装 pre-commit。

    pre-commit run --all-files --show-diff-on-failure --color=always
  5. 5透传引擎原生参数

    SGLang 参数加 --sglang- 前缀即可使用;Megatron 参数被 slime 直接读取,无需包装代码。

  6. 6按需扩展配置

    多轮/Agentic 场景可参考 PD 分离、SGLang YAML 配置、外部 rollout 引擎、增量权重同步等文档。

关键配置

配置项必填说明示例
--sglang-<原生参数>为任意 SGLang 原生参数加前缀后透传给推理引擎--sglang-mem-fraction-static 0.8
SGLang Config (YAML)可选的 YAML 扩展,用于拓扑控制、异构服务组、按组覆盖等见 docs/en/advanced/sglang-config.md

如何确认成功

按官方 Quick Start 文档跑通示例训练,能看到 rollout、数据生成与训练流程正常输出即视为成功。

常见问题

Q:README 里为什么没有 pip install 之类的安装命令?

A:README 把环境搭建与训练启动的完整说明放在 docs/en/get_started/quick_start.md,需以该文档为准,本教程不虚构安装命令。

Q:想使用 SGLang 的某个高级参数怎么办?

A:给该参数加 --sglang- 前缀即可,例如把 --mem-fraction-static 写成 --sglang-mem-fraction-static。

Q:Megatron 的并行、优化器、checkpoint 参数怎么传?

A:slime 直接读取 Megatron 参数,无需额外包装代码,原有参数均可用。

Q:多轮对话或 Agentic 场景资源需求不同怎么办?

A:可参考 PD Disaggregation 文档,把 prefill 与 decode 分离部署,并可用 router 策略做会话亲和。

注意事项

  • README 未给出具体安装命令,真实安装步骤请以官方 Quick Start 文档为准。
  • 推理侧只选用 SGLang 作为单一 rollout 后端,深度优化其 serving、路由、缓存与权重同步能力。
  • 生产环境训练/推理解耦、跨不同 GPU 型号部署时,可参考外部 rollout 引擎与从磁盘做全量/增量权重更新。
  • 提交代码前请运行 pre-commit 保证风格一致,调试问题可参考 Debugging Guide。

核心亮点

  • 训练与推理解耦,支持大规模并行采样,利于 RL 吞吐扩展
  • 面向 RL Scaling 设计,适合 RLHF/RLVR 等后训练流程
  • Python 实现,与主流分布式训练和推理后端兼容性较好

不足之处

  • 项目较新,文档与最佳实践仍在完善中
  • 生态与社区案例相对有限,长期维护待观察

适用场景

  • 大模型 RLHF 后训练流水线搭建
  • RLVR 可验证奖励强化学习训练
  • 需要高吞吐采样的大规模 RL 实验

替代项目

OpenRLHF、verl、TRL

项目介绍

slime 是一个模型训练领域的开源项目,官方简介:slime is an LLM post-training framework for RL Scaling.。项目使用 Python 开发,在 GitHub 上获得 8479 星标。

上一篇:Complete-LLM-Finetuning

下一篇:tunix

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 61327 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1279 2026-08-13