dreamtalk

一张照片加段语音,生成自然表情的说话视频

DreamTalk 是一个基于扩散概率模型的逼真说话人头生成项目,源自同名论文的官方实现。它解决的是从单张静态人脸图像和一段语音音频,生成具有自然表情、唇形同步和头部运动的动态说话视频的问题。其核心能力在于利用扩散模型的高质量生成能力,结合音频特征与视觉特征的跨模态对齐,实现表情丰富、口型准确且头部姿态自然的视频合成。项目提供了完整的训练和推理代码,支持自定义人脸和音频输入,并集成了多种预训练模型。技术栈涵盖音频-视觉学习、人脸动画和视频生成,适用于数字人、虚拟助手、影视制作和交互式应用等领域。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1789
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类视频生成
开发团队ali-vilab
所属国家
定价模式free
价格说明开源项目,MIT许可证,可免费使用和部署,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型audio-visual-learning,face-animation,talking-head,video-generation
GitHub 星标★ 1789
30天Star增速
HF 下载量
上线时间2023-12-28 00:00:00
最近更新2026-09-18 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 7 步

环境要求

  • 已安装 Conda(conda 命令可用)
  • Python 3.7.0(README 指定版本)
  • 支持 CUDA 11.1 的 NVIDIA GPU 环境(README 安装 cudatoolkit=11.1)
  • 磁盘空间用于存放依赖与模型权重

安装与启动步骤

  1. 1创建 Conda 环境

    按 README 指定版本创建名为 dreamtalk 的独立环境,Python 版本必须是 3.7.0,避免与其他项目依赖冲突。

    conda create -n dreamtalk python=3.7.0
  2. 2激活环境

    后续所有安装命令都要在 dreamtalk 环境中执行,若中途换终端需重新激活。

    conda activate dreamtalk
  3. 3安装基础依赖

    在项目根目录执行,安装 requirements.txt 中列出的 Python 依赖包。需先克隆或下载项目源码。

    pip install -r requirements.txt
  4. 4安装 PyTorch 与 CUDA

    通过 conda 安装 README 指定的 PyTorch 1.8.0、torchvision 0.9.0、torchaudio 0.8.0 及 cudatoolkit 11.1,注意要带 -c pytorch -c conda-forg

    conda install pytorch==1.8.0 torchvision==0.9.0 torchaudio==0.8.0 cudatoolkit=11.1 -c pytorch -c conda-forge
  5. 5更新 ffmpeg

    README 要求用 conda 更新 ffmpeg,用于后续音视频文件的读取与处理。

    conda update ffmpeg
  6. 6安装指定版本库

    分别固定安装 urllib3 1.26.6、transformers 4.28.1 和 dlib,版本不能随意升级,否则可能不兼容。

    pip install urllib3==1.26.6
    pip install transformers==4.28.1
    pip install dlib
  7. 7申请模型权重

    官方已停止公开下载 checkpoint,需发邮件到 mayf18@mails.tsinghua.edu.cn 申请,发信即表示同意使用方法。

如何确认成功

README 未提供启动命令;确认 conda activate dreamtalk 可正常激活、各依赖安装无报错,且已获得官方 checkpoint 授权。

常见问题

Q:预训练模型在哪里下载?

A:官方因社会影响已停止公开下载。需发送邮件至 mayf18@mails.tsinghua.edu.cn 申请获取 checkpoint。发送邮件即表示你同意使用该方法。

Q:Python 版本可以用 3.8/3.9 吗?

A:README 安装命令明确指定 python=3.7.0,建议严格按此版本创建环境,避免依赖冲突。

Q:为什么用 conda 装 PyTorch 而不是 pip?

A:README 给出的命令是 conda install pytorch==1.8.0 ... cudatoolkit=11.1 -c pytorch -c conda-forge,按原文执行可保证 CUDA 版本匹配。

Q:需要 GPU 吗?

A:安装命令中包含 cudatoolkit=11.1,说明官方环境面向 NVIDIA GPU,纯 CPU 环境未在 README 中说明。

注意事项

  • checkpoint 已停止公开下载,必须邮件申请,且发信即视为同意官方使用方法。
  • README 节选中未给出推理/运行命令,安装完成后如何生成视频请以官方仓库后续文档为准。
  • PyTorch、transformers、urllib3 均锁定了版本号,不要自行升级。
  • 安装 dlib 可能耗时较长,请保持网络与编译环境稳定。

核心亮点

  • 基于扩散模型,生成的人脸动态和表情比传统GAN方法更自然逼真
  • 官方实现,代码结构清晰,包含训练和推理流程,便于复现和二次开发
  • 支持多种音频和图像输入,灵活性强,社区活跃度较高

不足之处

  • 推理速度较慢,实时性不足,对硬件要求较高
  • 文档和社区支持相对有限,新手上手有一定门槛

适用场景

  • 数字人视频制作,如新闻播报、在线教育
  • 虚拟助手和客服的实时交互头像
  • 影视后期和游戏角色的面部动画生成

替代项目

SadTalker、Wav2Lip、MakeItTalk

项目介绍

dreamtalk 是数字人3D领域的开源项目,由 ali-vilab 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,789)位列前 30%,在数字人3D分类的 272 个项目里位列前 11%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-18。MIT许可证,可免费使用和部署,无付费版本。

它主要面向的使用场景是:数字人视频制作,如新闻播报、在线教育。同类可对比的替代方案包括 SadTalker、Wav2Lip、MakeItTalk。

同类项目推荐

A3D 开源

在 three.js 里直接调用 AI 生成纹理和素材,边建模边生成

3D x AI hybrid editor, built with three.js

★ 129 2026-08-09
cube 开源

用一句话生成 3D 模型,在 Roblox 里快速落地 AI 创作

Roblox Foundation Model for 3D Intelligence

★ 1254 2026-08-09
AG3D 开源

用2D图片直接生成3D虚拟人,告别昂贵扫描

Official code release for ICCV2023 paper AG3D: Learning to Generate 3D Avatars from ···

★ 272 2026-08-09
GameFactory-3A 开源

一条命令生成 3A 游戏资产,从模型到视频全自动

A comprehensive open-source 3A game-generation skill and asset framework.

★ 798 2026-08-21