fantasy-talking

让虚拟人说话更自然,动作表情不僵硬

FantasyTalking 是一个面向数字人领域的 3D 说话人像生成框架,由 ACM MM 2025 收录。它解决的是传统说话人像生成中头部运动与表情不协调、动作僵硬的问题,通过引入连贯运动合成机制,让生成的虚拟人物在说话时头部姿态、面部表情和口型变化更加自然流畅。核心能力包括基于 3D 建模的高保真人像重建、运动序列的连贯性优化,以及实时推理支持,能够从单张图片或视频中生成具有真实感的说话人像。项目采用 Python 实现,依赖主流的深度学习框架,提供了完整的训练和推理流程,适合用于虚拟主播、在线教育、影视制作等场景。目前项目处于成长阶段,社区活跃度较高,但文档和生态仍在完善中。

开源 free 数字人3D
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1630
维护状态 低维护
是否开源
定价模式 free

项目数据

分类数字人3D
开发团队Fantasy-AMAP
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型diffusion,diffusion-models,diffusion-transformer,talking-head
GitHub 星标★ 1630
30天Star增速
HF 下载量
上线时间2025-04-02 00:00:00
最近更新2026-09-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 4 步

环境要求

  • 已安装 Python 环境(项目为 Python 实现)
  • PyTorch >= 2.0.0
  • 可访问 GitHub、Huggingface 或 ModelScope 下载代码与模型权重
  • 磁盘/显存需容纳 Wan2.1-I2V-14B-720P 基座模型与 Wav2Vec 模型

安装与启动步骤

  1. 1克隆项目仓库

    从 GitHub 拉取 fantasy-talking 源码并进入项目目录,注意网络能否访问 GitHub。

    git clone https://github.com/Fantasy-AMAP/fantasy-talking.git
    cd fantasy-talking
  2. 2安装项目依赖

    按 requirements.txt 安装全部 Python 依赖,安装前请确认 torch 版本不低于 2.0.0。

    pip install -r requirements.txt
  3. 3可选安装 flash_attn

    README 标注为可选步骤,用于加速注意力计算;安装失败不影响基础依赖使用。

    pip install flash_attn
  4. 4下载模型权重

    需下载 Wan2.1-I2V-14B-720P 基座模型和 Wav2Vec 模型,README 仅提供 Huggingface/ModelScope 下载链接,按表格中的链接自行下载并放置。

如何确认成功

README 节选未给出启动或推理命令,无法直接验证;建议按仓库 docs/tips.md 用户指南与官网说明进一步确认运行方式。

常见问题

Q:需要安装 flash_attn 吗?

A:不是必需。README 中写明它是可选项,仅用于加速注意力计算,安装失败或环境不兼容时可跳过。

Q:模型权重从哪里下载?

A:README 表格提供了 Huggingface 与 ModelScope 两种镜像:Wan2.1-I2V-14B-720P 基座模型和 Wav2Vec(facebook/wav2vec2-base-960h)。

Q:安装或运行遇到问题怎么办?

A:项目于 2025 年 7 月发布了用户指南 docs/tips.md,用于解决社区反馈的常见问题,可优先查阅。

Q:可以在 ComfyUI 中使用吗?

A:可以,该项目已合并到 ComfyUI-WanVideoWrapper(kijai 维护),可通过 ComfyUI 调用。

注意事项

  • README 要求 torch >= 2.0.0,请提前升级 PyTorch。
  • Wan2.1-I2V-14B-720P 为 14B 参数模型,下载与运行对磁盘和显存要求较高。
  • README 节选未包含推理/训练运行命令,实际启动方式请以仓库 docs 及官网为准。
  • 项目仍在成长阶段,文档和生态持续完善中,建议关注仓库更新。

核心亮点

  • 提出连贯运动合成机制,显著提升头部运动与表情的协调性
  • 基于 3D 建模,生成的人像具有更好的几何一致性和真实感
  • 支持从单图或视频输入,适用性强,且推理速度较快

不足之处

  • 文档/社区待观察
  • 对训练数据质量要求较高,低质量输入可能影响效果

适用场景

  • 虚拟主播和数字人直播
  • 在线教育中的虚拟教师
  • 影视预演和游戏角色动画

替代项目

SadTalker、Wav2Lip、MetaHuman

项目介绍

fantasy-talking 是数字人3D领域的开源项目,由 Fantasy-AMAP 开发,2025 年首次发布。

在全站 12,961 个收录项目中,它的 GitHub 星标数(1,628)位列前 30%,在数字人3D分类的 272 个项目里位列前 13%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-18。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:虚拟主播和数字人直播。同类可对比的替代方案包括 SadTalker、Wav2Lip、MetaHuman。

上一篇:Speech2Video

下一篇:ScanTalk

同类项目推荐

A3D 开源

在 three.js 里直接调用 AI 生成纹理和素材,边建模边生成

3D x AI hybrid editor, built with three.js

★ 129 2026-08-09
cube 开源

用一句话生成 3D 模型,在 Roblox 里快速落地 AI 创作

Roblox Foundation Model for 3D Intelligence

★ 1254 2026-08-09
AG3D 开源

用2D图片直接生成3D虚拟人,告别昂贵扫描

Official code release for ICCV2023 paper AG3D: Learning to Generate 3D Avatars from ···

★ 273 2026-08-09
GameFactory-3A 开源

一条命令生成 3A 游戏资产,从模型到视频全自动

A comprehensive open-source 3A game-generation skill and asset framework.

★ 778 2026-08-21