echomimic_v3

1.3B小模型搞定数字人,音频文本驱动全身动画

EchoMimicV3 是一个面向数字人动画生成的开源项目,由 AAAI 2026 论文提出,核心思路是用 1.3B 参数的小模型统一实现多模态、多任务的人体动画生成。它解决传统数字人生成中模型体积大、任务分散(如仅音频驱动肖像或仅音频驱动身体)的问题,将音频驱动的肖像动画、身体动画以及多模态输入(如文本、音频、动作)整合到一个框架中。项目基于 Python 实现,支持从音频直接生成口型同步的肖像视频,也能生成全身动作动画,并允许用户通过文本或音频控制动作风格。其轻量级参数设计降低了部署门槛,适合实时或半实时应用。当前项目处于成长阶段,GitHub 星标已超千,社区活跃度较高,但文档和生态仍在完善中。

开源 unknown 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1063
维护状态 低维护
是否开源 是
定价模式 unknown

项目数据

分类视频生成
开发团队antgroup
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型audio-driven-body-animation,audio-driven-portrait-animations,human-animation,video-generation
GitHub 星标★ 1063
30天Star增速
HF 下载量
上线时间2025-07-24 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 系统:CentOS 7.2 或 Ubuntu 22.04(官方实测环境)
  • CUDA >= 12.1
  • Python 3.10 或 3.11
  • GPU:A100(80G) / RTX4090D(24G) / V100(16G) 等已测试显卡
  • Windows 用户可选用官方一键安装包(量化版)

安装与启动步骤

  1. 1核对软硬件环境

    先确认机器满足官方实测条件:CentOS 7.2/Ubuntu 22.04、CUDA>=12.1、Python 3.10/3.11,并准备已测试级别的 GPU。

  2. 2获取项目代码

    从 GitHub 克隆 EchoMimicV3 仓库到本地,后续所有操作都在该目录内进行。

    git clone https://github.com/antgroup/echomimic_v3.git
    cd echomimic_v3
  3. 3Windows 一键安装

    Windows 用户按 README 指引下载官方一键安装包(量化版),通过百度网盘链接获取,提取码为 glut。

  4. 4Linux 环境安装

    README 中“Installation for Linux”章节未给出具体命令,请打开仓库内 README_zh.md 或项目主页查看最新安装说明后再执行。

  5. 5准备模型权重

    按官方仓库指引下载模型权重;README 中给出的 HuggingFace 模型地址为 BadToBest/EchoMimicV3,请以该页面说明为准。

如何确认成功

README 未提供启动命令与验证方式,需按仓库 README_zh.md 中的示例命令运行后,确认能正常生成人物动画视频。

常见问题

Q:Windows 上怎么最快装好?

A:README 提供了一键安装包(量化版),通过百度网盘下载,提取码 glut,适合想快速体验的用户。

Q:Linux 的具体安装命令是什么?

A:本次 README 节选中 Linux 章节只有标题、没有命令,请以仓库 README_zh.md 和项目主页 https://antgroup.github.io/ai/echomimic_v3 的最新说明为准。

Q:需要什么样的显卡?

A:官方实测过的显卡为 A100(80G)、RTX4090D(24G)、V100(16G),显存越大越有利于生成高清长视频。

Q:Python 版本有要求吗?

A:已测试版本为 Python 3.10 和 3.11,建议使用这两个版本以避免依赖兼容问题。

Q:模型权重在哪里获取?

A:README 中给出了 HuggingFace 模型页 https://huggingface.co/BadToBest/EchoMimicV3,按该页面指引下载。

注意事项

  • CUDA 版本必须不低于 12.1,低于该版本可能出现运行异常。
  • 项目文档和生态仍在完善中,安装命令请以仓库最新 README_zh.md 为准,不要照搬过时教程。
  • 本项目面向人像/人体动画生成,请确保使用合规的图片、音频和视频素材。
  • 当前 README 节选未包含端口、配置文件等参数信息,本教程未做任何补全推测。

核心亮点

  • 统一多模态(音频/文本)和多任务(肖像/身体)动画生成,一个模型替代多个专用模型
  • 仅1.3B参数,相比大模型更轻量,推理资源需求低,便于部署到边缘设备
  • 基于 AAAI 2026 论文,技术有学术背书,方法新颖性强

不足之处

  • 项目处于成长阶段,文档和社区生态待观察
  • 1.3B参数虽小,但生成质量可能不及更大模型,需实测对比

适用场景

  • 数字人直播:音频驱动实时口型和身体动作生成
  • 短视频创作:文本或音频驱动快速生成人物动画素材
  • 虚拟助手/游戏NPC:轻量级模型实现低成本交互动画

替代项目

SadTalker、Wav2Lip、AnimateAnyone

项目介绍

echomimic_v3 是数字人3D领域的开源项目,由 antgroup 开发,2025 年首次发布。

在全站 13,109 个收录项目中,它的 GitHub 星标数(1,063)位列前 30%,在数字人3D分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,014 增加到 1,063,净增 49。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。从国内网络环境看,可直接访问。

它主要面向的使用场景是:数字人直播:音频驱动实时口型和身体动作生成。同类可对比的替代方案包括 SadTalker、Wav2Lip、AnimateAnyone。

上一篇:WorldForge

下一篇:HunyuanPortraitLCM

同类项目推荐

A3D 开源

在 three.js 里直接调用 AI 生成纹理和素材,边建模边生成

3D x AI hybrid editor, built with three.js

★ 129 2026-08-09
cube 开源

用一句话生成 3D 模型,在 Roblox 里快速落地 AI 创作

Roblox Foundation Model for 3D Intelligence

★ 1254 2026-08-09
AG3D 开源

用2D图片直接生成3D虚拟人,告别昂贵扫描

Official code release for ICCV2023 paper AG3D: Learning to Generate 3D Avatars from ···

★ 272 2026-08-09
GameFactory-3A 开源

一条命令生成 3A 游戏资产,从模型到视频全自动

A comprehensive open-source 3A game-generation skill and asset framework.

★ 798 2026-08-21