echomimic

上传音频和照片,一键生成逼真数字人说话视频,还能手动微调表情。

EchoMimic 是一个由 AAAI 2025 收录的音频驱动肖像动画生成项目,旨在通过音频和可编辑的面部关键点条件,生成逼真且可控的数字人视频。它解决了传统音频驱动动画中表情僵硬、口型同步差、缺乏编辑灵活性的问题。核心能力包括:利用音频特征驱动面部动作,同时支持用户手动编辑关键点(如眼睛、嘴巴)来精细控制表情;通过双阶段训练策略,将音频和关键点信息有效融合,生成高清晰度、自然流畅的动画。项目提供了完整的训练和推理代码,以及预训练模型,方便开发者快速部署和二次开发。

开源 free 数字人3D
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4302
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类数字人3D
开发团队antgroup
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可自由使用和部署,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型aaai2025,audio-driven-portrait-animations,audio-driven-talking-face,human-animation,talking-face-generation,talking-head
GitHub 星标★ 4302
30天Star增速
HF 下载量
上线时间2024-07-03 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 4 步

环境要求

  • 操作系统:CentOS 7.2 或 Ubuntu 22.04(README 实测环境)
  • CUDA >= 11.7,需 NVIDIA 显卡(实测 A100 80G / RTX4090D 24G / V100 16G)
  • Python 3.8 / 3.10 / 3.11(README 推荐 conda 创建 Python 3.8 环境)
  • 已安装 conda 与 pip

安装与启动步骤

  1. 1克隆项目代码

    从 GitHub 拉取 EchoMimic 源码到本地,随后进入项目根目录准备后续操作。

    git clone https://github.com/antgroup/echomimic.git
    cd echomimic
  2. 2创建 conda 环境

    README 推荐使用 conda 隔离环境,示例创建名为 echomimic 的 Python 3.8 环境并激活。

    conda create -n echomimic python=3.8
    conda activate echomimic
  3. 3安装依赖包

    在激活的 echomimic 环境中,按 requirements.txt 一次性安装项目所需 Python 依赖。

    pip install -r requirements.txt
  4. 4启动 Gradio 界面

    运行 webgui.py 启动网页交互界面,可通过 server_port 参数指定端口,默认示例为 3000。

    python -u webgui.py --server_port=3000

关键配置

配置项必填说明示例
--server_port否指定 Gradio Web 界面监听端口3000

如何确认成功

执行 webgui.py 后终端无报错,浏览器打开 http://localhost:3000 能看到 Gradio 操作界面即成功。

常见问题

Q:没有 GPU 或显存不足能跑吗?

A:README 实测显卡为 A100(80G)、RTX4090D(24G)、V100(16G),且要求 CUDA >= 11.7,显存较小的显卡可能无法正常运行。

Q:Python 版本有要求吗?

A:README 说明实测 Python 3.8 / 3.10 / 3.11 均可用,推荐按示例用 conda 创建 Python 3.8 环境以避免版本冲突。

Q:端口 3000 被占用怎么办?

A:启动时修改 --server_port 参数为其它空闲端口,例如 python -u webgui.py --server_port=3001。

Q:依赖安装失败怎么办?

A:先确认已 conda activate echomimic 激活环境,并检查 CUDA 版本是否满足 >= 11.7,再重试 pip install -r requirements.txt。

注意事项

  • README 节选未给出预训练模型权重的下载与推理脚本说明,实际使用前请补充查看官方仓库与 HuggingFace/ModelScope 模型页。
  • 启动 Web UI 依赖 Gradio,首次运行可能需下载相关资源,请保持网络畅通。
  • 建议在独立 conda 环境中安装,避免与系统 Python 包产生冲突。
  • 官方同时提供 HuggingFace 与 ModelScope 的在线 Demo,可先在线体验再决定本地部署。

核心亮点

  • 口型同步精度高,基于音频特征直接驱动,自然度优于传统方法。
  • 支持关键点编辑,用户可手动调整眼睛、嘴巴等区域,实现精细表情控制。
  • AAAI 2025 论文背书,算法有学术保障,且代码开源,易于复现。

不足之处

  • 训练和推理对 GPU 资源要求较高,个人开发者入门门槛不低。
  • 文档/社区待观察。

适用场景

  • 数字人视频制作,如虚拟主播、新闻播报。
  • 影视预可视化,快速生成角色口型动画。
  • 辅助配音演员,预览音频对应的面部动作。

替代项目

SadTalker、Wav2Lip、LivePortrait

项目介绍

echomimic 是数字人3D领域的开源项目,由 antgroup 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(4,302)位列前 10%,在数字人3D分类的 272 个项目里位列前 5%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可自由使用和部署,无付费版本。

它主要面向的使用场景是:数字人视频制作,如虚拟主播、新闻播报。同类可对比的替代方案包括 SadTalker、Wav2Lip、LivePortrait。

上一篇:JoyVASA

下一篇:Speech2Video

同类项目推荐

A3D 开源

在 three.js 里直接调用 AI 生成纹理和素材,边建模边生成

3D x AI hybrid editor, built with three.js

★ 129 2026-08-09
cube 开源

用一句话生成 3D 模型,在 Roblox 里快速落地 AI 创作

Roblox Foundation Model for 3D Intelligence

★ 1254 2026-08-09
AG3D 开源

用2D图片直接生成3D虚拟人,告别昂贵扫描

Official code release for ICCV2023 paper AG3D: Learning to Generate 3D Avatars from ···

★ 273 2026-08-09
GameFactory-3A 开源

一条命令生成 3A 游戏资产,从模型到视频全自动

A comprehensive open-source 3A game-generation skill and asset framework.

★ 778 2026-08-21