prime-rl

让智能体多轮强化学习训练轻松扩展到大规模

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2149
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类模型训练
开发团队PrimeIntellect-ai
所属国家
官网地址
定价模式free
价格说明开源免费,无在线服务,需自行部署
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 2149
30天Star增速
HF 下载量
上线时间2025-02-18 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-11
浏览次数0

项目介绍

prime-rl 是一个面向大规模智能体强化学习训练的开源框架,核心目标是解决传统 RL 训练流程在复杂多轮交互场景下难以扩展的问题。它把环境交互、策略采样与训练循环解耦,支持分布式并行采样与异步更新,让研究者能高效训练具备工具调用、多步推理能力的智能体模型。项目提供模块化接口,可接入自定义环境和奖励函数,并针对长序列、稀疏奖励等难点做了工程优化。相比通用 RL 库,它更聚焦于 LLM 智能体场景,强调可扩展性与训练稳定性,适合需要跑通大规模 agentic RL 实验的团队快速搭建训练管线。

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:高级 约 30 分钟 部署方式:本地安装 7 步

环境要求

  • NVIDIA GPU(官方在 RTX 3090/4090/5090、A100、H100、H200、B200 上开发测试)
  • Python 3.12
  • 已安装 git 与 uv
  • 跑通完整 RL 全流程需至少 2 张 GPU(SFT 与推理各需 1 张)

安装与启动步骤

  1. 1克隆仓库

    把 prime-rl 源码拉到本地并进入项目目录,后续所有命令都在该目录下执行。

    git clone https://github.com/PrimeIntellect-ai/prime-rl.git
    cd prime-rl
  2. 2初始化子模块

    拉取 verifiers、renderers、prime-envs、pydantic-config 四个依赖子模块,缺一会导致运行报错。

    git submodule update --init -- deps/verifiers deps/renderers deps/prime-envs deps/pydantic-config
  3. 3安装 uv

    安装 Python 包管理器 uv 并让当前终端识别它的命令,prime-rl 全部依赖由 uv 管理。

    curl -LsSf https://astral.sh/uv/install.sh | sh
    source $HOME/.local/bin/env
  4. 4安装依赖

    按锁文件安装全部依赖;注意该命令不会装训练环境包,需要时改用 --all-packages。

    uv sync --all-extras
  5. 5校验环境

    先确认 Python 版本为 3.12,再确认 flash-attn 能正常导入,避免后续训练中途失败。

    uv run python -V
    uv run python -c "import flash_attn"
  6. 6跑通 SFT 与推理

    用 1 张 GPU 分别验证 SFT 训练器和推理服务器能否启动,二者可分开执行。

    uv run sft @ configs/debug/fake/sft.toml
    uv run inference --vllm.model Qwen/Qwen3-0.6B
  7. 7端到端 RL 训练

    用 2 张 GPU 跑通推理 + 编排器 + 训练器的完整 RL 流程,这是环境就绪的最终标志。

    uv run rl @ examples/basic/reverse-text/rl.toml

关键配置

配置项必填说明示例
vllm.model否推理服务器加载的模型名称,不指定时使用配置默认值Qwen/Qwen3-0.6B
sft.toml否SFT 训练配置文件路径,通过 @ 方式传给 sft 命令configs/debug/fake/sft.toml
rl.toml否完整 RL 流程配置文件路径,通过 @ 方式传给 rl 命令examples/basic/reverse-text/rl.toml

如何确认成功

uv run rl @ examples/basic/reverse-text/rl.toml 能跑通端到端流程(需 2 张 GPU),且 uv run python -c "import flash_attn" 无报错。

常见问题

Q:没有 GPU 可以本地跑吗?

A:README 给出的验证命令都要求 GPU:SFT 与推理各需 1 张,完整 RL 需 2 张。纯 CPU 环境只能完成安装步骤,无法验证训练流程。

Q:为什么 uv sync --all-extras 装不上环境包?

A:环境属于可选的 uv workspace 成员,默认不安装。需要全部环境时用 uv sync --all-extras --all-packages,只装部分时用 uv sync --package prime-rl --package 。

Q:想用 W&B 记录训练日志怎么办?

A:先执行 uv run wandb login 完成登录,之后即可把训练 run 记录到 W&B。

Q:能不能直接一条命令完成安装?

A:可以,README 提供一键脚本 curl -sSL https://raw.githubusercontent.com/PrimeIntellect-ai/prime-rl/main/scripts/install.sh | bash,手动步骤仅在需要排查时使用。

注意事项

  • README 提供一键安装脚本:curl -sSL https://raw.githubusercontent.com/PrimeIntellect-ai/prime-rl/main/scripts/install.sh | bash
  • 环境包是 opt-in 的 uv workspace 成员,uv sync --all-extras 不会安装它们
  • 官方称可用 FSDP2 训练、vLLM 推理,支持 1000+ GPU 与 1T+ MoE 模型,并支持 Slurm 多节点部署
  • README 未给出 CPU 安装或纯推理无 GPU 的运行方式,本教程仅覆盖其列出的 GPU 验证路径

核心亮点

  • 面向智能体多轮交互场景设计,支持工具调用与长序列训练
  • 分布式采样与训练解耦,具备大规模并行扩展能力
  • 模块化接口,便于接入自定义环境和奖励函数

不足之处

  • 项目较新,文档和示例生态仍在完善中
  • 社区规模有限,遇到问题可参考的实践案例较少

适用场景

  • 训练能调用外部工具的 LLM 智能体
  • 多步推理与稀疏奖励场景下的策略优化研究
  • 搭建大规模分布式 RL 训练管线

替代项目

verl、OpenRLHF

上一篇:SlideFormer

下一篇:RLinf

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 63512 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1312 2026-08-13