echomimic_v2

一张半身照,AI 帮你生动出镜说话

蚂蚁集团开源的半身人像动画生成模型(CVPR 2025),在 EchoMimic 基础上实现更自然、更简化的半身人体动画,支持音频驱动的说话与动作同步,效果生动逼真,适合数字人创作。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4657
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类视频生成
开发团队antgroup
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型audio-driven-body-animation,audio-driven-portrait-animations,audio-driven-talking-face,cvpr2025,human-animation,talking-face-generation,talking-head,video-generation
GitHub 星标★ 4657
30天Star增速
HF 下载量
上线时间2024-11-20 00:00:00
最近更新2026-09-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数8

使用教程

难度:进阶 约 40 分钟 部署方式:本地安装 7 步

环境要求

  • CUDA >= 11.7(推荐 cu124 版 PyTorch)
  • Python 3.8 / 3.10 / 3.11(建议 3.10)
  • 已安装 conda(可选,推荐)
  • 显卡:A100(80G) / RTX4090D(24G) / V100(16G) 等,需较高显存
  • 系统:CentOS 7.2 或 Ubuntu 22.04 已验证

安装与启动步骤

  1. 1克隆项目代码

    从 GitHub 拉取 echomimic_v2 源码到本地目录,后续所有命令都在该目录内执行。

    git clone https://github.com/antgroup/echomimic_v2.git
    cd echomimic_v2
  2. 2一键自动安装

    README 提供 linux_setup.sh 自动安装脚本,会自动完成环境与依赖安装,最省事。

    sh linux_setup.sh
  3. 3创建 conda 环境

    手动安装时先建独立环境,避免污染系统 Python;推荐 Python 3.10。

    conda create -n echomimic python=3.10
    conda activate echomimic
  4. 4安装 PyTorch 等

    按 cu124 索引安装指定版本的 torch、torchvision、torchaudio 与 xformers。

    pip install pip -U
    pip install torch==2.5.1 torchvision==0.20.1 torchaudio==2.5.1 xformers==0.0.28.post3 --index-url https://download.pytorch.org/whl/cu124
  5. 5安装 torchao

    从 nightly cu124 源安装 torchao,供推理加速使用。

    pip install torchao --index-url https://download.pytorch.org/whl/nightly/cu124
  6. 6安装项目依赖

    安装 requirements.txt 中列出的全部依赖包。

    pip install -r requirements.txt
  7. 7安装 facenet_pytorch

    README 要求以 --no-deps 方式安装指定版本的 facenet_pytorch。

    pip install --no-deps facenet_pytorch==2.6.0

如何确认成功

执行 pip list 能看到 torch 2.5.1、xformers 0.0.28.post3、facenet_pytorch 2.6.0,且 python -c "import torch;print(torch.cuda.is_av

常见问题

Q:应该选自动安装还是手动安装?

A:有 Linux 环境且想省事直接用 sh linux_setup.sh;需要自定义 CUDA/Python 版本或排查问题时按手动步骤逐条安装。

Q:conda 必须装吗?

A:不是必须,但 README 推荐用 conda 建独立环境,可避免依赖冲突;用 venv 或系统 Python 也可,需保证版本为 3.8/3.10/3.11。

Q:显存不够怎么办?

A:README 实测过 V100(16G),显存过低可能无法运行原始分辨率,建议优先使用 24G 及以上显卡。

Q:为什么 torch 要指定 cu124 索引?

A:官方 wheel 才带对应 CUDA 支持,混用默认源可能装到 CPU 版导致无法使用 GPU。

注意事项

  • requirements.txt、linux_setup.sh 均在项目根目录,执行前确保已 cd 进 echomimic_v2
  • 模型权重需从 HuggingFace(BadToBest/EchoMimicV2)或 ModelScope 另行下载
  • README 的 README 节选未给出推理命令与权重存放路径,请以仓库官方文档为准
  • 建议全程在 conda 环境内执行,避免版本冲突

核心亮点

  • 首个支持半身人体动画的音频驱动方案,结合面部与身体动作生成,效果自然
  • 基于CVPR 2025论文,算法创新性强,在口型同步和动作协调性上表现突出
  • 提供完整训练和推理代码,支持自定义数据集,便于二次开发

不足之处

  • 文档/社区待观察
  • 对输入音频和人物姿态的鲁棒性有限,复杂场景下可能出现动作失真
  • 生成速度较慢,实时性不足,依赖高性能GPU

适用场景

  • 数字人视频制作,如虚拟主播、在线教育讲师
  • 影视预演与动画辅助,快速生成半身角色表演
  • 社交娱乐应用,如个性化虚拟形象动态生成

替代项目

SadTalker、Wav2Lip、AniPortrait

项目介绍

echomimic_v2 是数字人3D领域的开源项目,由 antgroup 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(4,657)位列前 10%,在数字人3D分类的 272 个项目里位列前 5%。

近 44 天,它的 GitHub 星标从 4,635 增加到 4,657,净增 22。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。Apache-2.0许可证,可免费使用和部署,无付费版本。

它主要面向的使用场景是:数字人视频制作,如虚拟主播、在线教育讲师。同类可对比的替代方案包括 SadTalker、Wav2Lip、AniPortrait。

上一篇:Duix-Avatar

下一篇:ai-brain-3d

同类项目推荐

A3D 开源

在 three.js 里直接调用 AI 生成纹理和素材,边建模边生成

3D x AI hybrid editor, built with three.js

★ 129 2026-08-09
cube 开源

用一句话生成 3D 模型,在 Roblox 里快速落地 AI 创作

Roblox Foundation Model for 3D Intelligence

★ 1254 2026-08-09
AG3D 开源

用2D图片直接生成3D虚拟人,告别昂贵扫描

Official code release for ICCV2023 paper AG3D: Learning to Generate 3D Avatars from ···

★ 273 2026-08-09
GameFactory-3A 开源

一条命令生成 3A 游戏资产,从模型到视频全自动

A comprehensive open-source 3A game-generation skill and asset framework.

★ 778 2026-08-21