VACE

一个模型搞定视频生成与编辑,多条件随心控

VACE 是一个基于扩散模型的全能视频生成与编辑框架,由腾讯等机构在 ICCV 2025 论文中提出。它解决的核心问题是:当前视频生成模型往往只能完成单一任务(如文生视频或图生视频),而 VACE 通过统一的条件编码器,将文本、图像、深度图、边缘图、姿态等多种控制信号融合到一个模型中,实现了文生视频、图生视频、视频编辑、视频补全、多条件组合生成等多种功能。其核心能力包括:支持任意组合的视觉条件输入,可对生成内容进行精细控制;基于预训练视频扩散模型(如 Stable Video Diffusion)进行微调,保持高质量生成;提供官方训练和推理代码,方便研究者复现和扩展。VACE 降低了视频创作的门槛,让用户无需专业剪辑技能即可完成复杂的视频生成与编辑任务。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3953
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类视频生成
开发团队ali-vilab
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,完全免费,需自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型video-editing,video-generation
GitHub 星标★ 3953
30天Star增速
HF 下载量
上线时间2025-03-08 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 40 分钟 部署方式:本地安装 8 步

环境要求

  • Python 3.10.13
  • CUDA 12.4(GPU 环境)
  • PyTorch >= 2.5.1
  • 磁盘空间用于存放基础模型到 /models/
  • 已安装 git 与 pip

安装与启动步骤

  1. 1克隆仓库

    把 VACE 源码拉到本地并进入项目根目录,后续所有命令都在该目录下执行。

    git clone https://github.com/ali-vilab/VACE.git && cd VACE
  2. 2安装 PyTorch

    若本机还没装 PyTorch,按 README 指定版本与 cu124 源安装,CUDA 版本需为 12.4。

    pip install torch==2.5.1 torchvision==0.20.1 --index-url https://download.pytorch.org/whl/cu124
  3. 3安装项目依赖

    安装仓库根目录 requirements.txt 中的推理依赖,建议使用虚拟环境隔离。

    pip install -r requirements.txt
  4. 4安装 Wan2.1 支持

    如果要使用基于 Wan2.1 的 VACE,需要额外安装 wan 包;不使用可跳过。

    pip install wan@git+https://github.com/Wan-Video/Wan2.1
  5. 5安装 LTX-Video 支持

    使用 LTX-Video-0.9 版 VACE 时安装,注意它可能与 Wan 依赖冲突。

    pip install ltx-video@git+https://github.com/Lightricks/LTX-Video@ltx-video-0.9.1 sentencepiece --no-deps
  6. 6下载基础模型

    把所选基础模型放到 /models/,并按下文推荐目录结构组织文件夹。

  7. 7安装预处理工具

    需要预处理(深度、边缘、姿态等)时安装 annotator 依赖,并下载 VACE-Annotators 到 models/。

    pip install -r requirements/annotator.txt
  8. 8运行端到端推理

    一条命令串联预处理与推理,输出默认写入 ./results/,示例为 V2V depth 任务。

    python vace/vace_pipeline.py --base wan --task depth --video assets/videos/test.mp4 --prompt 'xxx'

关键配置

配置项必填说明示例
--base是选择基础模型框架,示例使用 wan。wan
--task是指定控制/编辑任务类型,如 depth。depth
--mode否任务模式,例如 inpainting 时用 bbox。bbox
--bbox否bbox 模式下的目标区域坐标。50,50,550,700
--video是输入视频路径,用于生成或编辑。assets/videos/test.mp4
--prompt是文本提示词,控制生成内容。xxx

如何确认成功

命令执行完成后,输出视频及中间视频、mask、图片会默认保存在项目根目录的 ./results/ 下,检查该目录即可确认成功。

常见问题

Q:LTX-Video 和 Wan2.1 能装在同一个环境里吗?

A:README 明确提示 LTX 安装可能与 Wan 冲突,建议为两者分别建独立虚拟环境,避免依赖互相覆盖。

Q:模型文件应该放在哪里?

A:统一下载到 /models/ 下,并参考 README 推荐结构,例如 models/VACE-Wan2.1-1.3B-Preview、models/VACE-LTX-Video-0.9、models/VACE-Annotators。

Q:怎么知道其他任务该怎么传参?

A:参考仓库根目录的 run_vace_pipeline.sh、vace/vace_wan_inference.py、vace/vace_ltx_inference.py,以及 UserGuide.md 中的详细说明。

Q:只跑推理需要装预处理依赖吗?

A:vace_pipeline.py 会顺序执行预处理和模型推理,因此需要相关预处理工具;若单独调用推理脚本则可只装推理依赖。

注意事项

  • README 未给出显式端口或服务启动方式,本项目以命令行脚本方式运行,不涉及 Web 服务部署。
  • 文件下载(基础模型、VACE-Annotators、VACE-Benchmark)需手动进行,README 只给出目标目录。
  • 进行 prompt extension 时,编辑任务可能因扩展文本与输入视觉信息不匹配而影响最终效果,需谨慎使用。
  • 建议下载 VACE-Benchmark 到 /benchmarks/,与 run_vace_xxx.sh 中的示例路径保持一致。

核心亮点

  • 统一条件编码器,支持文本、图像、深度、姿态等任意组合输入,灵活性强
  • 基于 Stable Video Diffusion 微调,生成质量高且训练成本相对可控
  • 官方提供完整训练/推理代码和预训练模型,易于复现和二次开发

不足之处

  • 文档/社区待观察
  • 对显存和计算资源要求较高,普通用户难以本地部署

适用场景

  • 视频创作者快速生成带指定人物或场景的短片
  • 影视后期进行视频内容替换、风格迁移或局部编辑
  • 研究者进行多模态条件视频生成算法的实验与对比

替代项目

AnimateDiff、VideoComposer、ControlVideo

项目介绍

VACE 是视频领域的开源项目,由 ali-vilab 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,953)位列前 30%,在视频分类的 473 个项目里位列前 8%。

近 42 天,它的 GitHub 星标从 3,912 增加到 3,953,净增 41。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0 许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:视频创作者快速生成带指定人物或场景的短片。同类可对比的替代方案包括 AnimateDiff、VideoComposer、ControlVideo。

上一篇:Light-A-Video

下一篇:HunyuanCustom

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
MagicDance 开源

一张图+任意动作,生成身份不变的逼真人物视频

[ICML 2024] MagicPose(also known as MagicDance): Realistic Human Poses and Facial Ex···

★ 777 2026-08-09