Awesome-Process-Reward-Models

一站式索引过程奖励模型论文与代码,快速上手推理监督

Awesome-Process-Reward-Models 是一个面向大语言模型推理过程奖励模型(Process Reward Model, PRM)的资源合集,系统整理了该方向的论文、开源代码、数据集、评测基准与训练方法。它解决的核心问题是:随着 o1、R1 等强调长链推理的模型兴起,仅对最终答案打分的奖励模型已不足以指导逐步推理,研究者需要一份集中索引来快速定位过程级监督的工作。项目按主题归类,覆盖 PRM 的构建方式(人工标注、蒙特卡洛估计、自动生成)、与强化学习/搜索结合的应用,以及数学、代码等推理任务的评测资源,帮助算法工程师和研究者减少检索成本,快速对比不同技术路线并复现实验。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 180
维护状态 活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队RyanLiu112
所属国家
官网地址
定价模式free
价格说明开源免费资源合集
访问状态
是否开源
开源协议
主要语言
技术栈/模型large-language-model,o1,process-reward-model,r1
GitHub 星标★ 180
30天Star增速
HF 下载量
上线时间2025-02-24 00:00:00
最近更新2026-09-13 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

核心亮点

  • 按主题系统归类 PRM 相关论文、代码、数据集与评测基准,检索效率高
  • 紧跟 o1、R1 等推理模型热点,覆盖过程级监督这一前沿细分方向
  • 作为资源合集维护成本低,便于持续补充新工作,适合作为入门索引

不足之处

  • 本质是链接合集,缺少对各类方法的横向对比与选型建议
  • 项目早期星标较少,内容更新频率与社区活跃度有待观察

适用场景

  • 研究过程奖励模型时快速查找相关论文与开源实现
  • 为长链推理模型设计逐步监督训练方案时调研技术路线
  • 撰写 PRM 相关综述或课程材料时收集参考资料

替代项目

Awesome-LLM-Reasoning、Awesome-Reward-Model

项目介绍

Awesome-Process-Reward-Models 是一个评测安全领域的开源项目,官方简介:A comprehensive collection of process reward models.。项目使用 未知 开发,在 GitHub 上获得 180 星标。

上一篇:LLMEvaluation

下一篇:inspect_ai

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24