
LLM-RLHF-Tuning-with-PPO-and-DPO
一站式跑通大模型 RLHF:SFT 到 PPO/DPO 全流程
这是一个面向大模型对齐训练的完整工具包,围绕人类反馈强化学习(RLHF)流程,覆盖指令微调、奖励模型训练以及 PPO 和 DPO 两种主流对齐算法。项目解决的是从基础模型到符合人类偏好的对话模型之间缺少端到端可复现实现的问题:用户可以先做 SFT 指令微调,再训练奖励模型,最后用 PPO 或 DPO 完成偏好优化。它针对 Transformer 系列模型提供多种配置,并声称支持 Qwen 3.0 等较新模型。代码以 Python 编写,结构上把数据处理、训练脚本和配置分离,方便按阶段替换组件或调整超参。对于想理解 RLHF 全链路、快速跑通 PPO/DPO 对比实验的开发者,它提供了一个可直接参考和修改的工程骨架,而不是只停留在论文公式层面。
开源
free
模型训练
GitHub 星标
★ 194
维护状态
较活跃
是否开源
是
定价模式
free
项目数据
分类模型训练
开发团队raghavc
所属国家
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型
GitHub 星标★ 194
30天Star增速
HF 下载量
上线时间2024-03-18 00:00:00
最近更新2026-09-16 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0
使用教程
核心亮点
- 同时覆盖 SFT、奖励模型、PPO、DPO 四个阶段,链路完整
- 提供多种配置,便于对比 PPO 与 DPO 的训练差异
- 基于 Python 实现,代码结构清晰,适合二次修改和教学参考
不足之处
- 项目星标仅 193,属于早期项目,社区验证和长期维护待观察
- 文档与示例可能不够完善,新模型适配的稳定性需要自行验证
适用场景
- 学习 RLHF 全流程并动手复现 PPO/DPO 实验
- 在自有数据上做指令微调后接偏好对齐训练
- 对比 PPO 与 DPO 在同一模型和数据集上的效果差异
替代项目
trl、DeepSpeed-Chat、LLaMA-Factory
项目介绍
同类项目推荐
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···