talking-face-generation
本站收录 18 个带「talking-face-generation」标签的 AI 开源项目
SadTalkerSadTalker 是一个基于 CVPR 2023 论文的开源数字人项目,核心功能是输入一张静态人像照片和一段语音音频,生成逼真的说话视频。它通过学习 3D 运★ 14,108
echomimic_v2蚂蚁集团开源的半身人像动画生成模型(CVPR 2025),在 EchoMimic 基础上实现更自然、更简化的半身人体动画,支持音频驱动的说话与动作同步,效果生动★ 4,659
echomimicEchoMimic 是一个由 AAAI 2025 收录的音频驱动肖像动画生成项目,旨在通过音频和可编辑的面部关键点条件,生成逼真且可控的数字人视频。它解决了传统★ 4,305
SyncTalkSyncTalk 是一个基于 CVPR 2024 论文的高保真数字人说话头合成项目,核心解决传统说话头生成中嘴唇、表情、姿态与音频不同步的问题。它通过引入同步模★ 1,628
Awesome-Talking-Head-SynthesisAwesome-Talking-Head-Synthesis 是一个专注于语音驱动人脸合成(Talking Head Synthesis)领域的精选资源列表,旨★ 1,557
sd-wav2lip-uhqsd-wav2lip-uhq 是一个为 Automatic1111 Stable Diffusion WebUI 开发的扩展,旨在将 Wav2Lip 唇形同步模★ 1,421
ditto-talkingheadDitto 是一个面向实时可控说话人头像合成的运动空间扩散模型,发表于 ACM MM 2025。它解决的是传统音频驱动肖像动画中动作僵硬、可控性差、实时性不足的★ 899
IP_LAPIP_LAP 是 CVPR 2023 论文《Identity-Preserving Talking Face Generation with Landmark ★ 734
Awesome-Deepfake-Generation-and-Detection这是一个关于深度伪造(Deepfake)生成与检测的综述性资源列表,对应CSUR 2026论文。项目系统梳理了Deepfake领域的研究脉络,涵盖生成技术(如G★ 652
wav2lip_288x288Wav2Lip 288x288 是一个基于 Wav2Lip 的改进版本,专注于高分辨率(288x288)的唇形同步视频生成。它解决了原始 Wav2Lip 在低分★ 651
EDTalkEDTalk是一款基于ECCV 2024 Oral论文的官方PyTorch实现,专注于高保真、可编辑的说话人脸视频生成。它解决了传统说话人脸生成中姿态、表情和口★ 465
Text2VideoText2Video 是一个基于 ICASSP 2022 论文的开源项目,实现文本驱动的说话人视频合成。它通过音素字典将输入文本转换为语音,并驱动人物头像生成与★ 438
HunyuanPortraitLCMHunyuanPortraitLCM 是腾讯混元团队开源的肖像动画生成框架,对应 CVPR 2025 论文。它解决传统肖像动画中条件控制不精确、生成速度慢的问题★ 290
MoDAMoDA 是一个基于多模态扩散架构的说话头生成(Talking Head Generation)项目。它解决的是如何从单张静态人像和一段音频,生成自然、逼真、口★ 274
ICCV2023-MCNETMCNET是ICCV2023收录的说话头视频生成官方实现,针对现有方法在源人脸身份信息利用不充分、生成视频身份保持不佳的问题,提出隐式身份表示条件化的记忆补偿网★ 252
FaceTalkFaceTalk 是一个基于音频驱动的 3D 数字人头像动画生成框架,来自 CVPR 2024。它利用扩散模型将语音音频转化为神经参数化头部模型(如 FLAME★ 240
awesome-ai-talking-heads这是一个精选的“说话头像生成”资源列表,汇集了该领域有影响力的论文、突破性算法、关键GitHub仓库、视频教程等。项目旨在为AI爱好者、研究人员和图形学专业人士★ 74
ml-talking-face这是一个基于CVPR 2022论文的AI数字人说话视频生成项目,通过输入一段音频和一张静态人脸照片,即可生成人物嘴巴与音频同步的说话视频。项目核心解决的是数字人★ 54