PRIME

让大模型学会深度推理,强化学习训练一步到位

PRIME 是一个面向语言模型高级推理的可扩展强化学习(RL)解决方案。它解决了当前大模型在复杂推理任务上能力不足的问题,通过创新的 RL 训练框架,让模型在数学、代码等需要多步推理的场景中表现更优。核心能力包括:高效的策略优化算法、稳定的训练流程、以及对长链推理的显式支持。项目提供完整的训练管线,支持主流模型架构,并内置了多种奖励建模策略,帮助开发者快速将 RL 应用于自有模型。其设计注重可扩展性,能够从单机训练平滑过渡到分布式集群,降低大规模 RL 的工程门槛。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1872
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队PRIME-RL
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型llm,reasoning,rl
GitHub 星标★ 1872
30天Star增速
HF 下载量
上线时间2024-12-31 00:00:00
最近更新2026-09-19 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 30 分钟 部署方式:模型权重 6 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • NVIDIA GPU 与 CUDA 环境(示例使用 vLLM + torch.cuda)
  • Python 环境,需安装 torch、transformers、vllm、tqdm(源自 README 示例 import)
  • 可访问 HuggingFace 下载模型 PRIME-RL/Eurus-2-7B-PRIME(约 7B 参数)
  • Python 3.x 运行环境与足够磁盘空间存放模型权重

安装与启动步骤

  1. 1克隆项目仓库

    README 未给安装命令,先从项目地址拉取代码,得到 training、data_preprocessing、eval 三个目录。

    git clone https://github.com/PRIME-RL/PRIME.git
  2. 2进入项目目录

    切换到仓库根目录,后续脚本与数据准备都以该目录为基准。

    cd PRIME
  3. 3安装推理依赖

    README 推理示例导入了这些库,建议在独立虚拟环境中安装,版本按各自兼容性选择。

    pip install torch transformers vllm tqdm
  4. 4设置任务提示词

    数学题追加 Present the answer in LaTex format: oxed{Your answer};代码题追加代码输出提示词。

  5. 5编写推理脚本

    把 README 的 inference code 保存为 py 文件,按需修改 model_path 与 all_problems。

  6. 6运行推理验证

    执行保存的脚本,观察控制台打印的 completions 与推理步骤是否符合预期。

    python prime_inference.py

关键配置

配置项必填说明示例
model_path是要加载的模型路径或 HuggingFace 模型名PRIME-RL/Eurus-2-7B-PRIME
tensor_parallel_size否张量并行规模,示例取当前可见 GPU 数量torch.cuda.device_count()
gpu_memory_utilization否vLLM 占用的显存比例0.90
max_tokens否采样最大生成长度8192
temperature否采样温度,示例为贪心解码0.0
n否每个问题的采样条数1

如何确认成功

脚本打印出回答,内容含 [ASSESS]/[ADVANCE]/[OUTPUT] 等推理步骤并以 oxed{9.9} 给出结论即为成功。

常见问题

Q:训练、数据处理和评测代码分别在哪里?

A:README 说明 training 为训练实现与脚本,data_preprocessing 负责数据准备(尤其是数学数据),eval 为复现结果的评测脚本。

Q:隐式 PRM 的训练和评测怎么做?

A:README 指引到 PRIME-RL/ImplicitPRM 这个独立仓库,不在本仓库内提供。

Q:不同任务需要不同提示词吗?

A:需要。数学题使用 LaTex oxed{} 提示词,代码题使用要求以 ```python``` 代码块给出解答的提示词。

Q:有没有更省事的集成方式?

A:2025/03/12 起 PRIME 已合并进 veRL 主分支,可直接使用 volcengine/verl 的 recipe/prime 目录。

注意事项

  • README 未给出依赖清单与安装命令,pip 依赖由示例代码的 import 推断,请自行确认版本兼容。
  • 示例推理需要 GPU,vLLM 会按 tensor_parallel_size 与 gpu_memory_utilization 分配显存。
  • 数学与代码任务必须分别套用 README 提供的提示词模板,否则结果格式可能不符合预期。
  • 仓库仅提供训练/评测/数据处理代码目录说明,具体启动方式需进入各目录查看。

核心亮点

  • 提供开箱即用的 RL 训练管线,降低强化学习应用门槛
  • 针对长链推理优化,显著提升数学、代码等任务表现
  • 支持分布式扩展,适合大规模模型训练场景

不足之处

  • 文档/社区待观察
  • 对硬件资源要求较高,小团队可能难以复现

适用场景

  • 大模型数学推理能力增强
  • 代码生成与逻辑推理优化
  • 科研机构进行 RL 算法研究

替代项目

TRL、OpenRLHF、verl

项目介绍

PRIME 是模型训练领域的开源项目,由 PRIME-RL 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,872)位列前 30%,在模型训练分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-19。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:大模型数学推理能力增强。同类可对比的替代方案包括 TRL、OpenRLHF、verl。

上一篇:all-rl-algorithms

下一篇:katib

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13