verl-omni

给扩散和全模态模型做 RL 后训练,一套框架跑通

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1234
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类模型训练
开发团队verl-project
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型diffusion-models,flow-matching,grpo,minimax-h3,multimodal,qwen,reinforcement-learning,rlhf,vllm
GitHub 星标★ 1234
30天Star增速
HF 下载量
上线时间2026-04-21 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-12
浏览次数0

项目介绍

verl-omni 是字节跳动 verl 生态下面向多模态与全模态模型的强化学习训练框架,专注解决扩散模型(diffusion)和 omni 模型在 RL 后训练阶段缺少统一工具链的问题。传统 RLHF 框架多针对纯文本 LLM,难以处理图像、视频、音频等连续模态的奖励回传与策略更新,verl-omni 把 flow matching、GRPO 等算法与 vLLM 推理加速结合,支持 Qwen、MiniMax-H3 等模型的训练流程。核心能力包括:多模态奖励信号接入、扩散采样与 RL 循环的协同调度、基于 vLLM 的高吞吐 rollout,以及可复用的训练配置。它让研究者和工程团队能在同一套框架里完成从多模态数据到策略优化的闭环,降低为扩散/omni 模型单独搭建 RL 管线的成本。

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:高级 约 60 分钟 部署方式:本地安装 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 具备可用的 GPU 训练环境(用于扩散/多模态模型 RL 训练与 rollout)
  • 已准备 Python 环境(项目开发语言为 Python)
  • 可访问官方文档站点 verl-omni.readthedocs.io 以获取安装与快速开始说明
  • 了解基础 RL 训练流程(FlowGRPO / GRPO 等)

安装与启动步骤

  1. 1克隆代码仓库

    从 GitHub 拉取 verl-omni 源码到本地,README 未给出具体安装命令,后续步骤以官方文档为准。

    git clone https://github.com/verl-project/verl-omni.git
    cd verl-omni
  2. 2查阅官方安装文档

    README 明确指向 Installation 页面,安装依赖、环境变量等全部以该文档说明为准,不要自行猜测包名。

  3. 3查阅快速开始文档

    按 Quickstart 页面(flowgrpo_quickstart)跑通首个 FlowGRPO 训练流程,确认框架可正常运行。

  4. 4运行示例配方

    README 提供了 FlowGRPO 示例配方目录,可按其中说明对 Qwen-Image 文本渲染等任务进行训练。

如何确认成功

按官方 Quickstart 完成安装并跑通 FlowGRPO 示例训练,日志出现训练 step 推进即视为成功;README 未给出具体验证命令。

常见问题

Q:安装步骤在哪里?

A:README 未在正文给出安装命令,仅提供官方文档 Installation 链接:https://verl-omni.readthedocs.io/en/latest/start/install.html,请以该页面为准。

Q:如何快速上手训练?

A:参考官方 Quickstart:https://verl-omni.readthedocs.io/en/latest/start/flowgrpo_quickstart.html,按其流程运行 FlowGRPO 示例。

Q:扩散模型默认使用哪个 trainer?

A:自 2026-09 起,v1 trainer(TransferQueue + ReplayBuffer)成为扩散模型默认方案,旧的 v0 trainer 已弃用,但离线 DPO 仍按设计使用 v0。

Q:MiniMax-H3 支持哪些任务?

A:支持 T2VA、FL2VA 和 Ref2VA,既可配合 FlowGRPO 也可配合 DiffusionNFT,示例见 examples 下对应目录的 README。

注意事项

  • README 节选未包含任何安装命令、依赖清单、端口或配置文件说明,本教程步骤为基于仓库地址与官方文档链接的通用准备动作,实际安装请严格遵循官方文档。
  • v0 trainer 已弃用,新项目建议直接使用 v1 trainer;离线 DPO 例外,仍使用 v0。
  • 训练用模型权重与数据需自行按官方文档准备,README 未提供下载地址与路径。
  • 项目基于 verl 构建,如遇依赖冲突建议同时参考上游 verl 仓库说明。

核心亮点

  • 把 GRPO、flow matching 与 vLLM 推理整合进同一 RL 循环,多模态 rollout 吞吐有保障
  • 背靠 verl 生态,配置与训练接口延续性强,已有 LLM RL 经验可迁移
  • 覆盖 diffusion 与 omni 两类模型,填补多模态 RL 后训练工具空白

不足之处

  • 项目较新、星标规模有限,生产环境验证案例和文档完整度待观察
  • 多模态 RL 训练对显存和算力要求高,小团队上手门槛不低

适用场景

  • 为文生图/文生视频扩散模型做人类偏好对齐的 RL 微调
  • 训练能同时理解图像、音频、文本的 omni 模型并做 RLHF
  • 在 Qwen 等多模态基座上用 GRPO 做奖励驱动的策略优化实验

替代项目

OpenRLHF、TRL、verl

上一篇:sagemaker-training-toolkit

下一篇:finetrainers

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 63550 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1314 2026-08-13