
verifiers
一套接口搞定 RL 训练环境与评测
verifiers 是 Prime Intellect 开源的强化学习环境与评测库,面向大模型后训练(RLHF/RLVR)场景。它把「环境」抽象成统一接口:给定提示词和模型输出,环境负责打分、给奖励、返回可验证信号,从而让 PPO、GRPO 等 RL 算法可以直接在数学、代码、逻辑推理等任务上训练。库内自带一批可验证任务环境(如数学题、代码执行、工具调用),也支持自定义环境,并配套评测流程,方便在同一套标准下比较不同模型与训练策略。核心价值在于把「造 RL 环境」这件重复劳动标准化,减少每个任务都要重写数据加载、奖励计算、并行采样的问题,让研究者把精力放在算法和奖励设计上。Python 实现,接口偏轻量,适合快速接入现有训练框架。
项目数据
使用教程
环境要求
- Python 环境(verifiers 为 Python 实现)
- 可访问外网以下载 uv 安装脚本
- 推荐使用 uv 管理工具与依赖
- 建议安装 Prime CLI 以便与 Environments Hub 交互
安装与启动步骤
-
1安装 uv 工具
执行官方安装脚本把 uv 装到本机,uv 用于后续安装和运行命令行工具。安装后可能需要重开终端或按提示加载环境变量。
curl -LsSf https://astral.sh/uv/install.sh | sh -
2安装 Prime CLI
用 uv 以工具形式全局安装 prime 命令行,README 推荐用它来与 verifiers 环境交互。
uv tool install prime -
3获取仓库代码
README 未给出安装 verifiers 库本身的命令,如需本地查看源码与文档可克隆仓库;此命令为通用 Git 操作,非 README 明示。
git clone https://github.com/PrimeIntellect-ai/verifiers.git -
4阅读文档与示例
仓库 docs/ 目录含架构与用法说明,AGENTS.md 与 skills/ 面向编码代理,可先阅读了解环境接口再动手。
如何确认成功
运行 prime --help 或 prime --version 能正常输出帮助信息,即说明 Prime CLI 安装成功。
常见问题
Q:必须安装 Prime CLI 吗?
A:README 是「推荐」安装,用于与 Environments Hub 等平台交互;只阅读源码或自行开发环境时并非强制。
Q:uv 安装后命令找不到怎么办?
A:安装脚本会提示把 uv 加入 PATH,按提示重开终端或执行 source 更新环境变量后再试。
Q:README 里没有 verifiers 的 pip 安装命令?
A:节选部分只给出 uv 与 prime CLI 的安装方式,未提供 pip install 命令,请以仓库 docs/ 中的最新说明为准。
注意事项
- README 节选未提供 pip install verifiers 之类的库安装命令,请勿凭猜测执行。
- prime CLI 主要用于与 Environments Hub 及托管训练平台交互,本地开发环境可另按 docs/ 指引操作。
- 本项目与 prime-rl 训练框架、Prime Intellect 托管训练平台紧密集成,训练前需了解这些配套组件。
核心亮点
- 统一 Environment 抽象,奖励计算与采样流程标准化,接新任务只需实现少量方法
- 自带数学、代码等可验证任务环境,开箱即可跑 RL 训练与评测
- 与 Prime Intellect 的 RL 训练栈配套,便于复现和横向对比不同模型
不足之处
- 生态与文档仍在早期,部分环境依赖外部执行沙箱,部署成本不低
- 社区规模相对小,第三方环境与教程数量有限
适用场景
- 为大模型做数学/代码类 RLVR 强化学习训练
- 搭建可复现的模型评测流水线,对比不同 checkpoint
- 研究新的奖励函数或 RL 算法时快速搭实验环境
替代项目
OpenRLHF、verl、TRL
项目介绍
上一篇:nncf
同类项目推荐
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···