verifiers

一套接口搞定 RL 训练环境与评测

verifiers 是 Prime Intellect 开源的强化学习环境与评测库,面向大模型后训练(RLHF/RLVR)场景。它把「环境」抽象成统一接口:给定提示词和模型输出,环境负责打分、给奖励、返回可验证信号,从而让 PPO、GRPO 等 RL 算法可以直接在数学、代码、逻辑推理等任务上训练。库内自带一批可验证任务环境(如数学题、代码执行、工具调用),也支持自定义环境,并配套评测流程,方便在同一套标准下比较不同模型与训练策略。核心价值在于把「造 RL 环境」这件重复劳动标准化,减少每个任务都要重写数据加载、奖励计算、并行采样的问题,让研究者把精力放在算法和奖励设计上。Python 实现,接口偏轻量,适合快速接入现有训练框架。

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4624
维护状态 活跃
是否开源
定价模式 free

项目数据

分类模型训练
开发团队PrimeIntellect-ai
所属国家
官网地址
定价模式free
价格说明开源免费库,无在线服务
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型
GitHub 星标★ 4624
30天Star增速
HF 下载量
上线时间2025-01-22 00:00:00
最近更新2026-09-16 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-14
浏览次数0

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 4 步

环境要求

  • Python 环境(verifiers 为 Python 实现)
  • 可访问外网以下载 uv 安装脚本
  • 推荐使用 uv 管理工具与依赖
  • 建议安装 Prime CLI 以便与 Environments Hub 交互

安装与启动步骤

  1. 1安装 uv 工具

    执行官方安装脚本把 uv 装到本机,uv 用于后续安装和运行命令行工具。安装后可能需要重开终端或按提示加载环境变量。

    curl -LsSf https://astral.sh/uv/install.sh | sh
  2. 2安装 Prime CLI

    用 uv 以工具形式全局安装 prime 命令行,README 推荐用它来与 verifiers 环境交互。

    uv tool install prime
  3. 3获取仓库代码

    README 未给出安装 verifiers 库本身的命令,如需本地查看源码与文档可克隆仓库;此命令为通用 Git 操作,非 README 明示。

    git clone https://github.com/PrimeIntellect-ai/verifiers.git
  4. 4阅读文档与示例

    仓库 docs/ 目录含架构与用法说明,AGENTS.md 与 skills/ 面向编码代理,可先阅读了解环境接口再动手。

如何确认成功

运行 prime --help 或 prime --version 能正常输出帮助信息,即说明 Prime CLI 安装成功。

常见问题

Q:必须安装 Prime CLI 吗?

A:README 是「推荐」安装,用于与 Environments Hub 等平台交互;只阅读源码或自行开发环境时并非强制。

Q:uv 安装后命令找不到怎么办?

A:安装脚本会提示把 uv 加入 PATH,按提示重开终端或执行 source 更新环境变量后再试。

Q:README 里没有 verifiers 的 pip 安装命令?

A:节选部分只给出 uv 与 prime CLI 的安装方式,未提供 pip install 命令,请以仓库 docs/ 中的最新说明为准。

注意事项

  • README 节选未提供 pip install verifiers 之类的库安装命令,请勿凭猜测执行。
  • prime CLI 主要用于与 Environments Hub 及托管训练平台交互,本地开发环境可另按 docs/ 指引操作。
  • 本项目与 prime-rl 训练框架、Prime Intellect 托管训练平台紧密集成,训练前需了解这些配套组件。

核心亮点

  • 统一 Environment 抽象,奖励计算与采样流程标准化,接新任务只需实现少量方法
  • 自带数学、代码等可验证任务环境,开箱即可跑 RL 训练与评测
  • 与 Prime Intellect 的 RL 训练栈配套,便于复现和横向对比不同模型

不足之处

  • 生态与文档仍在早期,部分环境依赖外部执行沙箱,部署成本不低
  • 社区规模相对小,第三方环境与教程数量有限

适用场景

  • 为大模型做数学/代码类 RLVR 强化学习训练
  • 搭建可复现的模型评测流水线,对比不同 checkpoint
  • 研究新的奖励函数或 RL 算法时快速搭实验环境

替代项目

OpenRLHF、verl、TRL

项目介绍

verifiers 是一个模型训练领域的开源项目,官方简介:Our library for RL environments + evals。项目使用 Python 开发,在 GitHub 上获得 4611 星标。

上一篇:nncf

下一篇:olmoearth_pretrain

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 61694 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1279 2026-08-13