SyncTalk

让数字人说话口型精准同步,告别嘴型对不上的尴尬

SyncTalk 是一个基于 CVPR 2024 论文的高保真数字人说话头合成项目,核心解决传统说话头生成中嘴唇、表情、姿态与音频不同步的问题。它通过引入同步模块,在 NeRF 框架下对头部、躯干、嘴唇等部分进行解耦建模,并利用音频驱动实现精准的唇形同步和自然的表情变化。项目提供完整的训练和推理代码,支持自定义数据集训练,生成具有实时交互能力的 3D 数字人。其核心能力包括:高精度唇形同步、多视角一致性和动态细节还原,适用于虚拟主播、视频会议、游戏 NPC 等场景。

开源 free 数字人3D
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1627
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类数字人3D
开发团队ZiqiaoPeng
所属国家
定价模式free
价格说明开源项目,代码免费,需自行部署,无在线服务。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型audio-driven-talking-face,cvpr,cvpr2024,talking-face,talking-face-generation,talking-head
GitHub 星标★ 1627
30天Star增速
HF 下载量
上线时间2023-11-29 00:00:00
最近更新2026-09-01 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:高级 约 60 分钟 部署方式:本地安装 8 步

环境要求

  • Ubuntu 18.04(官方测试环境,另已添加 Windows 支持)
  • CUDA 11.3 与对应的 NVIDIA 显卡驱动
  • Anaconda/Miniconda(用于创建 conda 环境)
  • Python 3.8.8、PyTorch 1.12.1+cu113
  • 系统需可执行 sudo apt-get 安装 portaudio19-dev

安装与启动步骤

  1. 1克隆项目仓库

    把 SyncTalk 官方仓库拉到本地并进入项目根目录,后续所有命令都在这层目录执行。

    git clone https://github.com/ZiqiaoPeng/SyncTalk.git
    cd SyncTalk
  2. 2创建并激活环境

    用 conda 建一个 Python 3.8.8 的独立环境,避免与系统 Python 冲突。

    conda create -n synctalk python==3.8.8
    conda activate synctalk
  3. 3安装 PyTorch

    按官方测试版本安装 torch / torchvision / torchaudio 的 cu113 版本,需匹配本机 CUDA。

    pip install torch==1.12.1+cu113 torchvision==0.13.1+cu113 torchaudio==0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113
  4. 4安装系统音频库

    安装 portaudio19-dev,供音频处理相关依赖编译使用,需要 sudo 权限。

    sudo apt-get install portaudio19-dev
  5. 5安装 Python 依赖

    在项目根目录按 requirements.txt 安装其余 Python 包。

    pip install -r requirements.txt
  6. 6安装 PyTorch3D

    使用官方预编译 wheel 安装 pytorch3d(对应 py38/cu113/torch1.12.1)。若失败可改用项目自带脚本安装。

    pip install --no-index --no-cache-dir pytorch3d -f https://dl.fbaipublicfiles.com/pytorch3d/packaging/wheels/py38_cu113_pyt1121/download.html
  7. 7安装 TF 与扩展模块

    安装 tensorflow-gpu 2.8.1,并本地编译安装 freqencoder、shencoder、gridencoder、raymarching 四个 CUDA 扩展。

    pip install tensorflow-gpu==2.8.1
    pip install ./freqencoder
    pip install ./shencoder
    pip install ./gridencoder
    pip install ./raymarching
  8. 8运行评估推理

    在仓库根目录执行评估脚本,加载预训练模型对 May 数据做测试;加 --portrait 可把生成人脸贴回原图提升质量。

    python main.py data/May --workspace model/trial_may -O --test --asr_model ave
    python main.py data/May --workspace model/trial_may -O --test --asr_model ave --portrait

关键配置

配置项必填说明示例
data/May是第一个位置参数,指定要推理/训练的数据目录data/May
--workspace是模型工作目录,存放检查点与输出结果model/trial_may
-O否官方示例中的运行开关,随评估命令一起使用-O
--test是切换到测试/推理模式,不进行训练--test
--asr_model是指定音频视觉编码器,官方示例使用 aveave
--portrait否开启后将生成人脸贴回原图,画质更高(PSNR 37.644)--portrait

如何确认成功

命令正常跑完后会输出评估指标表格,含 PSNR、LPIPS、LMD;Portrait 模式应得到 PSNR 37.644、LPIPS 0.0117、LMD 2.825。

常见问题

Q:安装 PyTorch3D 报错怎么办?

A:README 提供了备选方案,直接执行 python ./scripts/install_pytorch3d.py 重新安装即可。

Q:想获得更高画质怎么办?

A:在评估命令末尾加 --portrait,把生成的人脸贴回原始图像,PSNR 可从 32.201 提升到 37.644,LPIPS 也更低。

Q:想要更快、画质更好的效果?

A:README 推荐尝试官方同源的 SyncTalk_2D 项目(github.com/ZiqiaoPeng/SyncTalk_2D)。

Q:没有本地显卡能跑吗?

A:官方提供了 Google Colab notebook,可在 README 中点击 Colab 徽章在线运行演示。

注意事项

  • 官方在 Ubuntu 18.04 + PyTorch 1.12.1 + CUDA 11.3 上测试通过,其他版本组合可能编译失败。
  • 四个 CUDA 扩展(freqencoder、shencoder、gridencoder、raymarching)需在项目根目录下用 pip install ./xxx 本地编译。
  • 代码与预训练模型已于 2024-03-04 发布,2024-04-28 补充了预处理代码。
  • README 未给出具体的训练命令与参数,如需自定义数据集训练请查阅仓库内脚本与文档。

核心亮点

  • 唇形同步精度高,基于音频特征对齐,显著减少口型延迟
  • 支持头部与躯干分离建模,姿态自然且背景稳定
  • 代码结构清晰,提供完整训练流程,易于复现论文结果

不足之处

  • 训练需要多视角视频数据,数据采集成本较高
  • 实时推理性能依赖 GPU,低端设备上难以流畅运行

适用场景

  • 虚拟主播和直播数字人,实现实时口型同步
  • 影视预演和游戏角色对话动画生成
  • 在线教育中的虚拟教师,提升教学自然度

替代项目

SadTalker、Wav2Lip、ER-NeRF

项目介绍

SyncTalk 是数字人3D领域的开源项目,由 ZiqiaoPeng 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,627)位列前 30%,在数字人3D分类的 272 个项目里位列前 13%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-01。代码免费,需自行部署,无在线服务。

它主要面向的使用场景是:虚拟主播和直播数字人,实现实时口型同步。同类可对比的替代方案包括 SadTalker、Wav2Lip、ER-NeRF。

上一篇:omnitalker

下一篇:ACTalker

同类项目推荐

A3D 开源

在 three.js 里直接调用 AI 生成纹理和素材,边建模边生成

3D x AI hybrid editor, built with three.js

★ 129 2026-08-09
cube 开源

用一句话生成 3D 模型,在 Roblox 里快速落地 AI 创作

Roblox Foundation Model for 3D Intelligence

★ 1254 2026-08-09
AG3D 开源

用2D图片直接生成3D虚拟人,告别昂贵扫描

Official code release for ICCV2023 paper AG3D: Learning to Generate 3D Avatars from ···

★ 272 2026-08-09
GameFactory-3A 开源

一条命令生成 3A 游戏资产,从模型到视频全自动

A comprehensive open-source 3A game-generation skill and asset framework.

★ 798 2026-08-21