
VeOmni
声明式配方,把任意模态大模型训练一键扩展到多机多卡
VeOmni 是字节跳动开源的多模态大模型训练框架,核心思路是「以模型为中心」的分布式配方库(Recipe Zoo)。它要解决的问题是:多模态模型(文本、图像、音频、视频等任意模态)在扩展到大规模分布式训练时,往往需要为每种模型结构手写复杂的并行策略和通信逻辑,工程量大且容易出错。VeOmni 把并行切分、通信、显存优化等分布式细节抽象成可复用的「配方」,用户只需按模型结构声明式地组合配方,就能把单卡训练代码平滑扩展到多机多卡,并支持任意模态输入的统一训练流程。框架内置了多种主流多模态模型的训练配方,覆盖从数据加载、序列并行、张量并行到流水线并行的完整链路,同时兼顾训练吞吐与显存效率,适合研究团队和工程团队快速验证并放大新模型。
项目数据
使用教程
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
环境要求
- Python 环境(项目开发语言为 Python)
- PyTorch(项目遵循 Torch native 设计,需依赖 PyTorch)
- 支持分布式训练的加速器环境(多卡/多机)
- 网络可访问 GitHub 与 readthedocs 文档站点
安装与启动步骤
-
1克隆代码仓库
从 GitHub 拉取 VeOmni 源码到本地,作为后续安装与运行的代码基础。
git clone https://github.com/ByteDance-Seed/VeOmni.git -
2查阅安装文档
README 未给出具体安装命令,请打开官方 Installation 文档,按其说明完成依赖安装。
-
3运行快速开始示例
按官方 Quick Start with Qwen3 文档,用 Qwen3 示例跑通一次训练流程,验证环境是否可用。
如何确认成功
README 未提供验证命令;以官方文档中的 Qwen3 快速开始示例能否正常跑通为准。
常见问题
Q:为什么没有具体的安装命令?
A:README 节选中安装说明只提供了指向官方文档的链接,未列出 pip/conda 等命令。请以 Installation 文档页内容为准,勿套用其他项目的命令。
Q:VeOmni 支持哪些模态?
A:按 README 描述,支持文本、图像、音频、视频等任意模态模型的预训练与后训练。
Q:需要 PyTorch-Lightning 或 HuggingFace Trainer 吗?
A:不需要。VeOmni 采用 trainer-free 设计,使用线性训练脚本;同时提供基础 trainer 作为文本或 VLM/Omni 模型训练及强化学习后端。
Q:有示例可以直接跑吗?
A:README 的 Quick Start 中提供了 Qwen3 示例链接,可作为上手参考。
注意事项
- README 未提供具体依赖清单、端口、路径等信息,安装步骤务必以官方文档为准。
- VeOmni 面向多机多卡分布式训练,建议先确认加速器与 PyTorch 环境版本匹配。
- 框架强调模块化与可替换性,实际训练脚本可能需要按自身模型结构做适配。
- 项目 star 数较多但 README 节选信息有限,遇到问题优先查阅官方文档站点。
核心亮点
- 以模型为中心的配方抽象,把并行策略与模型代码解耦,新增模型结构时改动量小
- 原生支持文本/图像/音频/视频等任意模态的统一训练流程,不局限于纯文本 LLM
- 内置多种主流多模态模型的分布式训练配方,可直接复用而非从零搭建并行逻辑
不足之处
- 项目较新、星标规模仍在成长,第三方模型覆盖和社区案例还不如成熟框架丰富
- 配方机制有一定学习成本,新手需要先理解其抽象约定才能灵活改造
适用场景
- 多模态大模型团队把单卡训练脚本扩展到多机多卡集群
- 研究团队快速验证新模态或新模型结构的分布式训练可行性
- 工程团队复用现成配方,降低大模型训练并行策略的开发和调试成本
替代项目
Megatron-LM、DeepSpeed、FairScale
项目介绍
下一篇:litData
同类项目推荐
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···