
MOVA
一句话生成音画同步视频,告别后期配音对齐
MOVA 是一个统一的多模态基础模型,能够在一个模型中同时生成同步的视频和音频,解决了传统视频生成中音画分离、需要额外配音或后期对齐的痛点。它基于扩散模型架构,支持文本到视频与音频的联合生成,并集成了 LoRA 微调能力,方便用户针对特定风格或场景进行定制。项目采用 Python 实现,并利用 SGLang 优化推理性能,适合研究与应用探索。其核心能力包括:同步生成高质量视频与对应音轨、多模态联合建模、以及灵活的扩展性。目前项目处于成长阶段,代码与文档已开源,但生态和社区支持尚在建设中。
项目数据
使用教程
环境要求
- Python 3.13(conda 环境 mova)
- 已安装并可使用 conda
- 已安装 ComfyUI,存在 ComfyUI/custom_nodes 目录
- 首次运行需联网,从 HuggingFace 自动下载模型权重
安装与启动步骤
-
1创建 conda 环境
新建名为 mova 的独立环境,指定 Python 3.13,避免与系统环境冲突。
conda create -n mova python=3.13 -y -
2激活环境
后续所有安装与运行命令都要在这个已激活的环境中执行。
conda activate mova -
3安装 MOVA
在 MOVA 仓库根目录执行该命令,以可编辑方式安装项目及其依赖。
pip install -e . -
4进入节点目录
切换到 ComfyUI 的自定义节点目录,为安装 MOVA 节点做准备。
cd ComfyUI/custom_nodes -
5克隆节点仓库
递归克隆 comfyui-mova 节点仓库,--recursive 用于一并拉取子模块。
git clone --recursive https://github.com/richservo/comfyui-mova.git -
6安装节点依赖
进入克隆下来的目录并安装其 requirements.txt 中的依赖包。
cd comfyui-mova pip install -r requirements.txt
如何确认成功
在 ComfyUI 中加载并使用 MOVA 节点,首次使用会自动从 HuggingFace 下载模型;能正常下载并完成一次生成即表示部署成功。
常见问题
Q:需要手动下载模型权重吗?
A:不需要。README 说明模型在首次使用时自动从 HuggingFace 下载,也可前往 OpenMOSS-Team 的 mova 合集页面查看权重。
Q:一定要用 Python 3.13 吗?
A:README 的环境搭建命令明确使用 python=3.13 创建 conda 环境,建议按此版本创建以保证兼容。
Q:显存要多大、支持哪些工作流?
A:README 未给出具体显存数值与工作流细节,请参考 comfyui-mova 仓库的 README 中的 VRAM 指南与工作流示例。
Q:主仓库代码怎么获取?
A:README 节选中未给出主仓库的克隆命令,请从 GitHub 项目页 https://github.com/OpenMOSS/MOVA 获取代码后再执行 pip install -e .。
注意事项
- pip install -e . 必须在 MOVA 仓库根目录执行,不要在 ComfyUI 目录下执行。
- ComfyUI 节点来自第三方仓库 richservo/comfyui-mova,其版本与主仓库可能不同步。
- MOVA 还提供 LoRA 微调与评测流程,具体用法参见 README 对应章节。
- 项目仍在成长阶段,文档与社区支持尚在建设中,遇到问题可加入 Discord 或飞书交流。
核心亮点
- 真正实现视频与音频的联合生成,无需外部配音或对齐工具
- 基于扩散模型与 LoRA,支持风格化定制和高效微调
- 集成 SGLang 推理优化,提升生成效率,适合实际部署
不足之处
- 项目处于早期,文档和社区支持尚待完善
- 训练和推理资源需求较高,普通硬件难以运行
适用场景
- 自动生成带背景音或对白的短视频素材
- 影视预可视化阶段快速生成音画同步的样片
- 游戏或虚拟内容中生成动态场景与配套音效
替代项目
VideoPoet、Make-A-Video、Diffusion2
项目介绍
上一篇:awesome-seedance-2.5-guide
下一篇:4DAnyone
同类项目推荐
MoneyPrinterTurbo
开源
输入一句话,高清短视频自动出炉,文案配音全包了
利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···
seedance-2.0-api
开源
快速上手字节Seedance 2.0,文本/图片一键生成视频
Seedance 2.0 API — text-to-video and image-to-video examples
openscreen
开源
免费无水印录屏做演示,替代 Screen Studio
Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···
auto-subs
开源
在剪辑软件里直接生成字幕,省去导出导入的麻烦
On-device subtitle generation that connects directly to DaVinci Resolve, Premiere, a···