MOVA

一句话生成音画同步视频,告别后期配音对齐

MOVA 是一个统一的多模态基础模型,能够在一个模型中同时生成同步的视频和音频,解决了传统视频生成中音画分离、需要额外配音或后期对齐的痛点。它基于扩散模型架构,支持文本到视频与音频的联合生成,并集成了 LoRA 微调能力,方便用户针对特定风格或场景进行定制。项目采用 Python 实现,并利用 SGLang 优化推理性能,适合研究与应用探索。其核心能力包括:同步生成高质量视频与对应音轨、多模态联合建模、以及灵活的扩展性。目前项目处于成长阶段,代码与文档已开源,但生态和社区支持尚在建设中。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1116
维护状态 活跃
是否开源
定价模式 free

项目数据

分类视频生成
开发团队OpenMOSS
所属国家
定价模式free
价格说明开源项目,免费使用,具体许可待确认
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型audio-generation,diffusion-models,lora,multimodal,sglang,text-to-video,video-audio-generation,video-generation
GitHub 星标★ 1116
30天Star增速
HF 下载量
上线时间2026-01-28 00:00:00
最近更新2026-09-15 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-07
浏览次数7

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 6 步

环境要求

  • Python 3.13(conda 环境 mova)
  • 已安装并可使用 conda
  • 已安装 ComfyUI,存在 ComfyUI/custom_nodes 目录
  • 首次运行需联网,从 HuggingFace 自动下载模型权重

安装与启动步骤

  1. 1创建 conda 环境

    新建名为 mova 的独立环境,指定 Python 3.13,避免与系统环境冲突。

    conda create -n mova python=3.13 -y
  2. 2激活环境

    后续所有安装与运行命令都要在这个已激活的环境中执行。

    conda activate mova
  3. 3安装 MOVA

    在 MOVA 仓库根目录执行该命令,以可编辑方式安装项目及其依赖。

    pip install -e .
  4. 4进入节点目录

    切换到 ComfyUI 的自定义节点目录,为安装 MOVA 节点做准备。

    cd ComfyUI/custom_nodes
  5. 5克隆节点仓库

    递归克隆 comfyui-mova 节点仓库,--recursive 用于一并拉取子模块。

    git clone --recursive https://github.com/richservo/comfyui-mova.git
  6. 6安装节点依赖

    进入克隆下来的目录并安装其 requirements.txt 中的依赖包。

    cd comfyui-mova
    pip install -r requirements.txt

如何确认成功

在 ComfyUI 中加载并使用 MOVA 节点,首次使用会自动从 HuggingFace 下载模型;能正常下载并完成一次生成即表示部署成功。

常见问题

Q:需要手动下载模型权重吗?

A:不需要。README 说明模型在首次使用时自动从 HuggingFace 下载,也可前往 OpenMOSS-Team 的 mova 合集页面查看权重。

Q:一定要用 Python 3.13 吗?

A:README 的环境搭建命令明确使用 python=3.13 创建 conda 环境,建议按此版本创建以保证兼容。

Q:显存要多大、支持哪些工作流?

A:README 未给出具体显存数值与工作流细节,请参考 comfyui-mova 仓库的 README 中的 VRAM 指南与工作流示例。

Q:主仓库代码怎么获取?

A:README 节选中未给出主仓库的克隆命令,请从 GitHub 项目页 https://github.com/OpenMOSS/MOVA 获取代码后再执行 pip install -e .。

注意事项

  • pip install -e . 必须在 MOVA 仓库根目录执行,不要在 ComfyUI 目录下执行。
  • ComfyUI 节点来自第三方仓库 richservo/comfyui-mova,其版本与主仓库可能不同步。
  • MOVA 还提供 LoRA 微调与评测流程,具体用法参见 README 对应章节。
  • 项目仍在成长阶段,文档与社区支持尚在建设中,遇到问题可加入 Discord 或飞书交流。

核心亮点

  • 真正实现视频与音频的联合生成,无需外部配音或对齐工具
  • 基于扩散模型与 LoRA,支持风格化定制和高效微调
  • 集成 SGLang 推理优化,提升生成效率,适合实际部署

不足之处

  • 项目处于早期,文档和社区支持尚待完善
  • 训练和推理资源需求较高,普通硬件难以运行

适用场景

  • 自动生成带背景音或对白的短视频素材
  • 影视预可视化阶段快速生成音画同步的样片
  • 游戏或虚拟内容中生成动态场景与配套音效

替代项目

VideoPoet、Make-A-Video、Diffusion2

项目介绍

MOVA 是一个视频生成领域的开源项目,官方简介:A foundation model that generates synchronized video and audio in a single model。项目使用 Python 开发,在 GitHub 上获得 1109 星标。

上一篇:awesome-seedance-2.5-guide

下一篇:4DAnyone

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 124233 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 348 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 2982 2026-08-10
auto-subs 开源

在剪辑软件里直接生成字幕,省去导出导入的麻烦

On-device subtitle generation that connects directly to DaVinci Resolve, Premiere, a···

★ 4224 2026-08-10