项目预览
项目数据
项目介绍
Star 增长趋势
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
技术标签
使用教程
—
环境要求
- NVIDIA GPU(官方在 RTX 3090/4090/5090、A100、H100、H200、B200 上开发测试)
- Python 3.12
- 已安装 git 与 uv
- 跑通完整 RL 全流程需至少 2 张 GPU(SFT 与推理各需 1 张)
安装与启动步骤
-
1克隆仓库
把 prime-rl 源码拉到本地并进入项目目录,后续所有命令都在该目录下执行。
git clone https://github.com/PrimeIntellect-ai/prime-rl.git cd prime-rl -
2初始化子模块
拉取 verifiers、renderers、prime-envs、pydantic-config 四个依赖子模块,缺一会导致运行报错。
git submodule update --init -- deps/verifiers deps/renderers deps/prime-envs deps/pydantic-config -
3安装 uv
安装 Python 包管理器 uv 并让当前终端识别它的命令,prime-rl 全部依赖由 uv 管理。
curl -LsSf https://astral.sh/uv/install.sh | sh source $HOME/.local/bin/env -
4安装依赖
按锁文件安装全部依赖;注意该命令不会装训练环境包,需要时改用 --all-packages。
uv sync --all-extras -
5校验环境
先确认 Python 版本为 3.12,再确认 flash-attn 能正常导入,避免后续训练中途失败。
uv run python -V uv run python -c "import flash_attn" -
6跑通 SFT 与推理
用 1 张 GPU 分别验证 SFT 训练器和推理服务器能否启动,二者可分开执行。
uv run sft @ configs/debug/fake/sft.toml uv run inference --vllm.model Qwen/Qwen3-0.6B -
7端到端 RL 训练
用 2 张 GPU 跑通推理 + 编排器 + 训练器的完整 RL 流程,这是环境就绪的最终标志。
uv run rl @ examples/basic/reverse-text/rl.toml
关键配置
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
vllm.model | 否 | 推理服务器加载的模型名称,不指定时使用配置默认值 | Qwen/Qwen3-0.6B |
sft.toml | 否 | SFT 训练配置文件路径,通过 @ 方式传给 sft 命令 | configs/debug/fake/sft.toml |
rl.toml | 否 | 完整 RL 流程配置文件路径,通过 @ 方式传给 rl 命令 | examples/basic/reverse-text/rl.toml |
如何确认成功
uv run rl @ examples/basic/reverse-text/rl.toml 能跑通端到端流程(需 2 张 GPU),且 uv run python -c "import flash_attn" 无报错。
常见问题
Q:没有 GPU 可以本地跑吗?
A:README 给出的验证命令都要求 GPU:SFT 与推理各需 1 张,完整 RL 需 2 张。纯 CPU 环境只能完成安装步骤,无法验证训练流程。
Q:为什么 uv sync --all-extras 装不上环境包?
A:环境属于可选的 uv workspace 成员,默认不安装。需要全部环境时用 uv sync --all-extras --all-packages,只装部分时用 uv sync --package prime-rl --package
Q:想用 W&B 记录训练日志怎么办?
A:先执行 uv run wandb login 完成登录,之后即可把训练 run 记录到 W&B。
Q:能不能直接一条命令完成安装?
A:可以,README 提供一键脚本 curl -sSL https://raw.githubusercontent.com/PrimeIntellect-ai/prime-rl/main/scripts/install.sh | bash,手动步骤仅在需要排查时使用。
注意事项
- README 提供一键安装脚本:curl -sSL https://raw.githubusercontent.com/PrimeIntellect-ai/prime-rl/main/scripts/install.sh | bash
- 环境包是 opt-in 的 uv workspace 成员,uv sync --all-extras 不会安装它们
- 官方称可用 FSDP2 训练、vLLM 推理,支持 1000+ GPU 与 1T+ MoE 模型,并支持 Slurm 多节点部署
- README 未给出 CPU 安装或纯推理无 GPU 的运行方式,本教程仅覆盖其列出的 GPU 验证路径
核心亮点
- 面向智能体多轮交互场景设计,支持工具调用与长序列训练
- 分布式采样与训练解耦,具备大规模并行扩展能力
- 模块化接口,便于接入自定义环境和奖励函数
不足之处
- 项目较新,文档和示例生态仍在完善中
- 社区规模有限,遇到问题可参考的实践案例较少
适用场景
- 训练能调用外部工具的 LLM 智能体
- 多步推理与稀疏奖励场景下的策略优化研究
- 搭建大规模分布式 RL 训练管线
替代项目
verl、OpenRLHF
上一篇:SlideFormer
下一篇:RLinf
同类项目推荐
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···
