项目预览
项目数据
项目介绍
Star 增长趋势
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
技术标签
使用教程
—
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
环境要求
- 具备可用的 GPU 训练环境(用于扩散/多模态模型 RL 训练与 rollout)
- 已准备 Python 环境(项目开发语言为 Python)
- 可访问官方文档站点 verl-omni.readthedocs.io 以获取安装与快速开始说明
- 了解基础 RL 训练流程(FlowGRPO / GRPO 等)
安装与启动步骤
-
1克隆代码仓库
从 GitHub 拉取 verl-omni 源码到本地,README 未给出具体安装命令,后续步骤以官方文档为准。
git clone https://github.com/verl-project/verl-omni.git cd verl-omni -
2查阅官方安装文档
README 明确指向 Installation 页面,安装依赖、环境变量等全部以该文档说明为准,不要自行猜测包名。
-
3查阅快速开始文档
按 Quickstart 页面(flowgrpo_quickstart)跑通首个 FlowGRPO 训练流程,确认框架可正常运行。
-
4运行示例配方
README 提供了 FlowGRPO 示例配方目录,可按其中说明对 Qwen-Image 文本渲染等任务进行训练。
如何确认成功
按官方 Quickstart 完成安装并跑通 FlowGRPO 示例训练,日志出现训练 step 推进即视为成功;README 未给出具体验证命令。
常见问题
Q:安装步骤在哪里?
A:README 未在正文给出安装命令,仅提供官方文档 Installation 链接:https://verl-omni.readthedocs.io/en/latest/start/install.html,请以该页面为准。
Q:如何快速上手训练?
A:参考官方 Quickstart:https://verl-omni.readthedocs.io/en/latest/start/flowgrpo_quickstart.html,按其流程运行 FlowGRPO 示例。
Q:扩散模型默认使用哪个 trainer?
A:自 2026-09 起,v1 trainer(TransferQueue + ReplayBuffer)成为扩散模型默认方案,旧的 v0 trainer 已弃用,但离线 DPO 仍按设计使用 v0。
Q:MiniMax-H3 支持哪些任务?
A:支持 T2VA、FL2VA 和 Ref2VA,既可配合 FlowGRPO 也可配合 DiffusionNFT,示例见 examples 下对应目录的 README。
注意事项
- README 节选未包含任何安装命令、依赖清单、端口或配置文件说明,本教程步骤为基于仓库地址与官方文档链接的通用准备动作,实际安装请严格遵循官方文档。
- v0 trainer 已弃用,新项目建议直接使用 v1 trainer;离线 DPO 例外,仍使用 v0。
- 训练用模型权重与数据需自行按官方文档准备,README 未提供下载地址与路径。
- 项目基于 verl 构建,如遇依赖冲突建议同时参考上游 verl 仓库说明。
核心亮点
- 把 GRPO、flow matching 与 vLLM 推理整合进同一 RL 循环,多模态 rollout 吞吐有保障
- 背靠 verl 生态,配置与训练接口延续性强,已有 LLM RL 经验可迁移
- 覆盖 diffusion 与 omni 两类模型,填补多模态 RL 后训练工具空白
不足之处
- 项目较新、星标规模有限,生产环境验证案例和文档完整度待观察
- 多模态 RL 训练对显存和算力要求高,小团队上手门槛不低
适用场景
- 为文生图/文生视频扩散模型做人类偏好对齐的 RL 微调
- 训练能同时理解图像、音频、文本的 omni 模型并做 RLHF
- 在 Qwen 等多模态基座上用 GRPO 做奖励驱动的策略优化实验
替代项目
OpenRLHF、TRL、verl
同类项目推荐
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···
