mini-verl 是模型训练领域的开源项目,由 DaoyuanLi2816 开发,是 2026 年新上线的项目。
它收录于模型训练分类,该分类目前共有 531 个项目,GitHub 星标数为 304。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-15。开源免费,PyPI可安装。
它主要面向的使用场景是:个人开发者用一张4090复现GRPO对齐实验。同类可对比的替代方案包括 verl、TRL、OpenRLHF。

单张消费级显卡就能跑 PPO/GRPO 对齐训练
mini-verl 是字节跳动 verl 强化学习训练框架的轻量单卡版本,目标是在一张消费级 NVIDIA GPU(如 RTX 3090/4090)上跑通大模型对齐训练。它把原本需要多卡集群的 PPO、GRPO 以及 on-policy 知识蒸馏流程做了显存与工程简化,让个人开发者也能用单卡完成从 SFT 模型到 RLHF 风格对齐的完整实验。核心能力包括:支持 PPO 与 GRPO 两种主流策略优化算法,支持 on-policy distillation 做教师模型到学生模型的知识迁移,集成 PEFT/LoRA 降低显存占用,并保留 verl 的模块化设计便于替换 reward model 与 rollout 逻辑。项目定位不是生产级大规模训练,而是教学、复现和小规模 agentic RL 实验的入门工具,适合想理解 RLHF 内部机制但缺少多卡资源的开发者。
verl、TRL、OpenRLHF
mini-verl 是模型训练领域的开源项目,由 DaoyuanLi2816 开发,是 2026 年新上线的项目。
它收录于模型训练分类,该分类目前共有 531 个项目,GitHub 星标数为 304。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-15。开源免费,PyPI可安装。
它主要面向的使用场景是:个人开发者用一张4090复现GRPO对齐实验。同类可对比的替代方案包括 verl、TRL、OpenRLHF。
上一篇:verl-vla
下一篇:没有了!
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···