
Awesome-Process-Reward-Models
一站式索引过程奖励模型论文与代码,快速上手推理监督
Awesome-Process-Reward-Models 是一个面向大语言模型推理过程奖励模型(Process Reward Model, PRM)的资源合集,系统整理了该方向的论文、开源代码、数据集、评测基准与训练方法。它解决的核心问题是:随着 o1、R1 等强调长链推理的模型兴起,仅对最终答案打分的奖励模型已不足以指导逐步推理,研究者需要一份集中索引来快速定位过程级监督的工作。项目按主题归类,覆盖 PRM 的构建方式(人工标注、蒙特卡洛估计、自动生成)、与强化学习/搜索结合的应用,以及数学、代码等推理任务的评测资源,帮助算法工程师和研究者减少检索成本,快速对比不同技术路线并复现实验。
项目数据
使用教程
核心亮点
- 按主题系统归类 PRM 相关论文、代码、数据集与评测基准,检索效率高
- 紧跟 o1、R1 等推理模型热点,覆盖过程级监督这一前沿细分方向
- 作为资源合集维护成本低,便于持续补充新工作,适合作为入门索引
不足之处
- 本质是链接合集,缺少对各类方法的横向对比与选型建议
- 项目早期星标较少,内容更新频率与社区活跃度有待观察
适用场景
- 研究过程奖励模型时快速查找相关论文与开源实现
- 为长链推理模型设计逐步监督训练方案时调研技术路线
- 撰写 PRM 相关综述或课程材料时收集参考资料
替代项目
Awesome-LLM-Reasoning、Awesome-Reward-Model
项目介绍
上一篇:LLMEvaluation
下一篇:inspect_ai
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents