rllm

让LLM强化学习训练像搭积木一样简单,快速提升模型推理能力。

rllm是一个致力于将强化学习(RL)技术普及到大型语言模型(LLM)训练与推理中的开源框架。它主要解决当前LLM在复杂推理、决策和智能体任务中依赖监督微调、泛化能力不足的问题,通过提供分布式训练基础设施和智能体工作流支持,让开发者能够更便捷地应用强化学习来优化模型。核心能力包括:支持多种RL算法(如PPO、GRPO等)与LLM的集成,提供高效的分布式训练管线,内置智能体(agent)框架和编码智能体(coding-agent)支持,可灵活构建从环境交互到策略更新的闭环。项目采用Python编写,技术栈覆盖机器学习基础设施、智能体工作流和LLM推理,旨在降低RL应用门槛,使研究者和工程师无需从零搭建复杂系统即可提升模型的推理与决策能力。

开源 free 智能体
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 5832
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类智能体
开发团队rllm-org
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型agent-framework,agentic-workflow,coding-agent,distributed-training,llm-reasoning,llm-training,machine-learning,ml-infrastructure,ml-platform,reinforcement-learning,search-agent,swe-agent,tinker,verl
GitHub 星标★ 5832
30天Star增速
HF 下载量
上线时间2025-01-26 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 4 步

环境要求

  • Python >= 3.11
  • 已安装 uv(安装命令使用 uv pip)
  • 网络可访问 GitHub,从源码仓库拉取安装
  • (可选)需要多卡分布式训练时准备 verl 后端环境,单机可用 tinker 后端

安装与启动步骤

  1. 1确认 Python 版本

    rLLM 要求 Python >= 3.11,版本过低请先升级 Python 再执行后续安装。

    python --version
  2. 2安装 rllm

    官方推荐用 uv pip 直接从 GitHub 仓库安装;此命令默认安装运行 rllm CLI 所需依赖及 tinker(单机、Tinker API)后端。

    uv pip install "rllm @ git+https://github.com/rllm-org/rllm.git"
  3. 3按需安装其他后端

    README 说明上述安装只覆盖 tinker 后端;verl(多卡分布式)、fireworks 等后端需另行安装,原文该段内容被截断,请以官网文档为准。

  4. 4运行基准测试验证

    README 提供 rllm eval 命令可自动拉取并运行 60+ 内置基准(如 Terminal-Bench 2.0、AIME、MATH-500)。把 换成具体基准名即可,能正常拉取运行说明环境就绪。

如何确认成功

执行 rllm eval 能自动拉取并成功运行目标基准任务,即表示 rllm CLI 与后端环境安装成功。

常见问题

Q:安装后就能用所有训练后端吗?

A:不能。该命令只安装 tinker(单机)后端依赖,verl(分布式多卡)、fireworks 等后端需另外安装,README 中对应说明被截断,请查官网文档。

Q:可以换其他沙箱执行智能体吗?

A:可以。rLLM 支持 Docker、Daytona、Modal 或本地沙箱,并提供快照与预热池加速以降低训练规模的 rollout 开销。

Q:支持哪些训练方法?

A:支持 GRPO、REINFORCE、RLOO、SFT、on-policy distillation 等,并可用一个标志在多个训练后端之间切换,评测与训练共用同一份智能体代码。

Q:Python 版本不够 3.11 怎么办?

A:README 明确要求 Python >= 3.11,请先升级解释器或使用对应版本虚拟环境后再安装。

注意事项

  • README 的 Installation 只给出 pip/源码安装方式,Quickstart 部分未提供具体命令,本节步骤均来自 README 明确内容,其余用法请参考官网 https://docs.rllm-project.com。
  • rllm eval 中的 为基准名称占位,需替换为实际基准名(README 举例 Terminal-Bench 2.0、SWE-bench、AIME、MATH-500 等)。
  • 安装走 git+https 拉取源码,国内网络可能较慢,建议保证 GitHub 可访问。
  • 若计划做多机多卡分布式训练,需额外准备 verl 后端环境与相应硬件资源。

核心亮点

  • 提供开箱即用的分布式RL训练管线,显著降低LLM强化学习落地门槛
  • 内置智能体框架和编码智能体支持,可直接用于复杂推理与工具调用场景
  • 支持多种主流RL算法(PPO/GRPO等),灵活适配不同模型和任务需求

不足之处

  • 项目处于成长阶段,文档和社区生态尚待完善
  • 对大规模训练的资源调度和稳定性仍需更多生产环境验证

适用场景

  • 提升开源LLM在数学、代码等推理任务上的表现
  • 训练具备工具调用和自主决策能力的智能体
  • 在私有数据上定制化强化学习,优化垂直领域模型

替代项目

TRL (Hugging Face)、OpenRLHF、verl

项目介绍

rllm 是模型训练领域的开源项目,由 rllm-org 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(5,832)位列前 8%,在模型训练分类的 522 个项目里位列前 9%。

近 41 天,它的 GitHub 星标从 5,784 增加到 5,832,净增 48。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。Apache-2.0 许可证,可免费使用和部署。

它主要面向的使用场景是:提升开源LLM在数学、代码等推理任务上的表现。同类可对比的替代方案包括 TRL (Hugging Face)、OpenRLHF、verl。

上一篇:UniRL

下一篇:FreeFuse

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13