learning-from-rewards-llm-papers

一站式索引LLM奖励学习论文,快速掌握领域脉络

这是一个聚焦于大语言模型(LLM)后训练与测试时扩展中“从奖励中学习”主题的论文合集。项目系统梳理了奖励模型(RM)与学习策略在训练、推理及推理后阶段的相关研究,旨在为研究者和工程师提供一份结构化的参考资料,帮助他们快速了解该领域的关键方法、演进脉络与前沿动态。项目以GitHub仓库形式维护,按主题分类收录论文,并可能附带简要注释或链接,解决了该方向文献分散、难以系统追踪的问题。其核心能力在于知识组织与导航,适合作为入门综述或持续跟踪的索引。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 74
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队bobxwu
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言
技术栈/模型guided-decoding,large-language-models,llm,llms,post-training,reinforcement-learning,reward-learning,reward-model,reward-modeling,reward-models,self-correction,test-time-scaling
GitHub 星标★ 74
30天Star增速
HF 下载量
上线时间2025-05-06 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

核心亮点

  • 主题聚焦且细分,覆盖训练、推理、后推理全阶段,便于精准定位
  • 以合集形式整理,节省文献检索时间,适合快速入门
  • 紧跟测试时扩展等前沿方向,对研究选题有参考价值

不足之处

  • 项目处于早期(74星),内容完整性和维护持续性待观察
  • 缺乏代码或可运行示例,仅提供论文列表,实用性有限
  • 文档和分类细节可能不够完善,需自行探索

适用场景

  • 研究LLM奖励模型与强化学习方向的学者快速了解文献
  • 工程师寻找后训练与测试时扩展的技术方案参考
  • 学生或新人通过论文列表构建该领域知识体系

替代项目

awesome-llm-reward-modeling、awesome-rl4llm、LLM-Papers

项目介绍

learning-from-rewards-llm-papers 是数据集领域的开源项目,由 bobxwu 开发,2025 年首次发布。

它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 74。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:研究LLM奖励模型与强化学习方向的学者快速了解文献。同类可对比的替代方案包括 awesome-llm-reward-modeling、awesome-rl4llm、LLM-Papers。

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1647 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09