mini-verl

单张消费级显卡就能跑 PPO/GRPO 对齐训练

mini-verl 是字节跳动 verl 强化学习训练框架的轻量单卡版本,目标是在一张消费级 NVIDIA GPU(如 RTX 3090/4090)上跑通大模型对齐训练。它把原本需要多卡集群的 PPO、GRPO 以及 on-policy 知识蒸馏流程做了显存与工程简化,让个人开发者也能用单卡完成从 SFT 模型到 RLHF 风格对齐的完整实验。核心能力包括:支持 PPO 与 GRPO 两种主流策略优化算法,支持 on-policy distillation 做教师模型到学生模型的知识迁移,集成 PEFT/LoRA 降低显存占用,并保留 verl 的模块化设计便于替换 reward model 与 rollout 逻辑。项目定位不是生产级大规模训练,而是教学、复现和小规模 agentic RL 实验的入门工具,适合想理解 RLHF 内部机制但缺少多卡资源的开发者。

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 304
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类模型训练
开发团队DaoyuanLi2816
所属国家
官网地址
定价模式free
价格说明开源免费,PyPI可安装
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型agentic-rl,alignment,consumer-gpu,grpo,knowledge-distillation,llm,llm-agents,llm-alignment,on-policy-distillation,peft,post-training,ppo,qlora,qwen,reinforcement-learning,single-gpu,tool-use,verl
GitHub 星标★ 304
30天Star增速
HF 下载量
上线时间2026-07-27 00:00:00
最近更新2026-09-15 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-30
浏览次数0

使用教程

核心亮点

  • 单卡即可运行 PPO、GRPO 与 on-policy 蒸馏,显存门槛远低于原版 verl
  • 继承 verl 模块化设计,rollout、reward、trainer 可替换,便于改实验
  • 集成 PEFT/LoRA,进一步压低消费级 GPU 的显存占用

不足之处

  • 仅面向单卡小规模场景,吞吐和并行能力有限,不适合生产训练
  • 早期项目,文档与社区案例相对少,踩坑需自行读源码

适用场景

  • 个人开发者用一张 4090 复现 GRPO 对齐实验
  • 高校课程或自学中理解 PPO/RLHF 训练流程
  • 小团队在单卡上做 agentic RL 的快速原型验证

替代项目

verl、TRL、OpenRLHF

项目介绍

mini-verl 是模型训练领域的开源项目,由 DaoyuanLi2816 开发,是 2026 年新上线的项目。

它收录于模型训练分类,该分类目前共有 531 个项目,GitHub 星标数为 304。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-15。开源免费,PyPI可安装。

它主要面向的使用场景是:个人开发者用一张4090复现GRPO对齐实验。同类可对比的替代方案包括 verl、TRL、OpenRLHF。

上一篇:verl-vla

下一篇:没有了!

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62897 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1298 2026-08-13