audio-driven-talking-face
本站收录 12 个带「audio-driven-talking-face」标签的 AI 开源项目
SadTalkerSadTalker 是一个基于 CVPR 2023 论文的开源数字人项目,核心功能是输入一张静态人像照片和一段语音音频,生成逼真的说话视频。它通过学习 3D 运★ 14,108
echomimic_v2蚂蚁集团开源的半身人像动画生成模型(CVPR 2025),在 EchoMimic 基础上实现更自然、更简化的半身人体动画,支持音频驱动的说话与动作同步,效果生动★ 4,659
echomimicEchoMimic 是一个由 AAAI 2025 收录的音频驱动肖像动画生成项目,旨在通过音频和可编辑的面部关键点条件,生成逼真且可控的数字人视频。它解决了传统★ 4,305
Stable-Video-InfinityStable-Video-Infinity 是一个面向无限长度视频生成的开源项目,被 ICLR 26 接收为 Oral 论文。它针对现有视频扩散模型在长视频生成★ 2,578
SyncTalkSyncTalk 是一个基于 CVPR 2024 论文的高保真数字人说话头合成项目,核心解决传统说话头生成中嘴唇、表情、姿态与音频不同步的问题。它通过引入同步模★ 1,628
sd-wav2lip-uhqsd-wav2lip-uhq 是一个为 Automatic1111 Stable Diffusion WebUI 开发的扩展,旨在将 Wav2Lip 唇形同步模★ 1,421
JoyVASAJoyVASA 是一个基于扩散模型的数字人动画生成框架,专注于人像和动物肖像的动画化。它解决了传统动画生成中表情僵硬、动作不自然、跨物种适配困难等问题,核心能力★ 880
IP_LAPIP_LAP 是 CVPR 2023 论文《Identity-Preserving Talking Face Generation with Landmark ★ 734
wav2lip_288x288Wav2Lip 288x288 是一个基于 Wav2Lip 的改进版本,专注于高分辨率(288x288)的唇形同步视频生成。它解决了原始 Wav2Lip 在低分★ 651
fantasy-talking2FantasyTalking2 是一个基于扩散模型的音频驱动人像动画生成项目,发表于 AAAI 2026。它解决的是传统方法在音频-视觉同步和动作自然度上的不足★ 65
NeRFFaceSpeech_CodeNeRFFaceSpeech_Code 是一个基于 NeRF(神经辐射场)的 3D 说话头生成开源项目,对应 CVPRW 2024 论文。它解决的是从单张人脸图★ 63
ScanTalkScanTalk 是一个基于 ECCV 2024 论文的开源项目,专注于从非配准的 3D 扫描数据生成说话头部动画。它解决了传统 3D 说话头方法依赖精细配准模★ 55