talking-head

本站收录 60 个带「talking-head」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

SadTalkerSadTalker 是一个基于 CVPR 2023 论文的开源数字人项目,核心功能是输入一张静态人像照片和一段语音音频,生成逼真的说话视频。它通过学习 3D 运★ 14,108AudioGPTAudioGPT 是一个多模态音频处理框架,旨在统一理解和生成语音、音乐、声音以及说话头(Talking Head)等音频相关任务。它解决了传统音频模型功能单一★ 10,169LiveTalkingLiveTalking 是一个面向实时交互场景的开源数字人项目,主打流式生成和低延迟对话。它通过音频驱动口型同步,结合 NeRF 三维重建与渲染技术,让虚拟形象★ 9,655echomimic_v2蚂蚁集团开源的半身人像动画生成模型(CVPR 2025),在 EchoMimic 基础上实现更自然、更简化的半身人体动画,支持音频驱动的说话与动作同步,效果生动★ 4,659echomimicEchoMimic 是一个由 AAAI 2025 收录的音频驱动肖像动画生成项目,旨在通过音频和可编辑的面部关键点条件,生成逼真且可控的数字人视频。它解决了传统★ 4,305PersonaLive面向直播场景的表情丰富人像动画生成技术(CVPR 2026),以单张人像照片驱动生动自然的说话与表情动画,专注实时直播应用,让静态形象拥有媲美真人的表现力。★ 3,859Thin-Plate-Spline-Motion-ModelThin-Plate-Spline-Motion-Model 是一个基于 CVPR 2022 论文的图像动画开源项目,核心解决从单张静态图片生成动态视频的问题。★ 3,606awesome-talking-head-generation这是一个汇集了数字人/说话头生成领域最前沿技术与资源的精选列表,旨在解决该领域资料分散、入门门槛高的问题。项目按技术路线(如NeRF、3DMM、Diffusio★ 1,933dreamtalkDreamTalk 是一个基于扩散概率模型的逼真说话人头生成项目,源自同名论文的官方实现。它解决的是从单张静态人脸图像和一段语音音频,生成具有自然表情、唇形同步★ 1,788CyberVerseCyberVerse 是一个自托管的实时数字人智能体平台,旨在帮助开发者快速构建以语音交互为核心的 AI 代理。它解决了传统语音助手缺乏人格化形象和记忆能力的问★ 1,685fantasy-talkingFantasyTalking 是一个面向数字人领域的 3D 说话人像生成框架,由 ACM MM 2025 收录。它解决的是传统说话人像生成中头部运动与表情不协调★ 1,630SyncTalkSyncTalk 是一个基于 CVPR 2024 论文的高保真数字人说话头合成项目,核心解决传统说话头生成中嘴唇、表情、姿态与音频不同步的问题。它通过引入同步模★ 1,628TalkingHeadTalkingHead 是一个基于 JavaScript 的实时口型同步类库,专门用于驱动全身 3D 虚拟形象说话。它解决了开发者快速为 3D 角色添加自然说话★ 1,572Awesome-Talking-Head-SynthesisAwesome-Talking-Head-Synthesis 是一个专注于语音驱动人脸合成(Talking Head Synthesis)领域的精选资源列表,旨★ 1,557sd-wav2lip-uhqsd-wav2lip-uhq 是一个为 Automatic1111 Stable Diffusion WebUI 开发的扩展,旨在将 Wav2Lip 唇形同步模★ 1,421VideoChatVideoChat 是一个基于 Python 的实时交互数字人开源项目,旨在解决传统数字人开发门槛高、交互延迟大的问题。它允许用户自定义数字人的形象和音色,并支★ 1,313pireelPireel 是一个开源的 AI 视频编辑与生成平台,旨在成为 CapCut 和 ChatCut 的开源替代品。它通过 MCP(模型上下文协议)接口,允许任何 ★ 1,249CVPR2022-DaGANDaGAN 是 CVPR 2022 收录的论文《Depth-Aware Generative Adversarial Network for Talking H★ 997ditto-talkingheadDitto 是一个面向实时可控说话人头像合成的运动空间扩散模型,发表于 ACM MM 2025。它解决的是传统音频驱动肖像动画中动作僵硬、可控性差、实时性不足的★ 899JoyVASAJoyVASA 是一个基于扩散模型的数字人动画生成框架,专注于人像和动物肖像的动画化。它解决了传统动画生成中表情僵硬、动作不自然、跨物种适配困难等问题,核心能力★ 880IP_LAPIP_LAP 是 CVPR 2023 论文《Identity-Preserving Talking Face Generation with Landmark ★ 734Awesome-Deepfake-Generation-and-Detection这是一个关于深度伪造(Deepfake)生成与检测的综述性资源列表,对应CSUR 2026论文。项目系统梳理了Deepfake领域的研究脉络,涵盖生成技术(如G★ 652wav2lip_288x288Wav2Lip 288x288 是一个基于 Wav2Lip 的改进版本,专注于高分辨率(288x288)的唇形同步视频生成。它解决了原始 Wav2Lip 在低分★ 651ai-avatar-system开箱即用的 AI 数字人平台,上传一张照片、克隆一段声音,即可通过唇形同步视频与任意面孔实时对话。完全开源、支持自托管,基于 Claude、Whisper、Ch★ 511EDTalkEDTalk是一款基于ECCV 2024 Oral论文的官方PyTorch实现,专注于高保真、可编辑的说话人脸视频生成。它解决了传统说话人脸生成中姿态、表情和口★ 465ACTalkerACTalker 是一个基于视频扩散模型的端到端说话头生成框架,由 ICCV 2025 论文提出。它解决的是传统说话头合成中控制信号单一、生成效果不自然的问题,★ 465Text2VideoText2Video 是一个基于 ICASSP 2022 论文的开源项目,实现文本驱动的说话人视频合成。它通过音素字典将输入文本转换为语音,并驱动人物头像生成与★ 438omnitalkerOmniTalker 是一个基于 NeurIPS 2025 论文实现的实时文本驱动说话头生成项目,采用 JavaScript 技术栈,核心能力是在音频-视觉风格★ 426DiffPoseTalkDiffPoseTalk 是一个基于扩散模型的语音驱动 3D 面部动画与头部姿态生成开源项目。它解决的是从单一语音输入生成自然、富有表现力且风格可调的 3D 数★ 362HunyuanPortraitHunyuanPortrait 是腾讯混元团队开源的肖像动画框架,核心解决传统肖像驱动中显式条件(如关键点、深度图)控制粒度不足的问题。它提出隐式条件控制机制,★ 351Audio2HeadAudio2Head 是一个基于 IJCAI 2021 论文的音频驱动说话头生成项目,专注于实现一次性(one-shot)的头部自然运动合成。它解决了传统说话头★ 351OTAvatarOTAvatar 是一个基于 CVPR2023 论文的一次性说话人脸头像生成框架,核心目标是用单张静态人脸照片即可驱动生成可说话的 3D 头像。它通过可控的三平★ 324HunyuanPortraitLCMHunyuanPortraitLCM 是腾讯混元团队开源的肖像动画生成框架,对应 CVPR 2025 论文。它解决传统肖像动画中条件控制不精确、生成速度慢的问题★ 290MoDAMoDA 是一个基于多模态扩散架构的说话头生成(Talking Head Generation)项目。它解决的是如何从单张静态人像和一段音频,生成自然、逼真、口★ 274LIHQLIHQ 是一个用于生成高质量 AI 虚拟主播/数字人视频的开源项目,核心目标是实现长文本推理下的高质量合成说话人效果。它结合了深度学习、文本转语音和数字人技术★ 264ICCV2023-MCNETMCNET是ICCV2023收录的说话头视频生成官方实现,针对现有方法在源人脸身份信息利用不充分、生成视频身份保持不佳的问题,提出隐式身份表示条件化的记忆补偿网★ 252FaceTalkFaceTalk 是一个基于音频驱动的 3D 数字人头像动画生成框架,来自 CVPR 2024。它利用扩散模型将语音音频转化为神经参数化头部模型(如 FLAME★ 240Talking_Face_AvatarTalking_Face_Avatar 是一个基于深度伪造技术的角色与游戏资产头像生成项目。它主要解决开发者在游戏、虚拟角色或数字人场景中,快速生成具有动态表情★ 236DAWN-pytorchDAWN-pytorch 是论文《Dynamic Frame Avatar with Non-autoregressive Diffusion Framewor★ 233Co-Speech-Motion-GenerationCo-Speech-Motion-Generation 是一个从语音生成自由人体动作的开源项目,主要面向数字人、虚拟角色和动画制作领域。它解决了传统动作生成依赖★ 210latent-pose-reenactment这是CVPR 2020论文《Neural Head Reenactment with Latent Pose Descriptors》的官方实现,用于数字人头部★ 181cut-directorChatCut TalkDirector(cut-director)是一个面向数字人视频制作的智能导演工具。它读取口播脚本,自动编排动态图形、生成视觉元素、设计★ 178NEDNED是CVPR 2022提出的视频人脸表情编辑工具,基于PyTorch实现。它解决的是视频中演员面部情绪的精准操控问题,用户可以通过指定情绪标签(如开心、悲伤★ 160lipsynclipsync 是一个基于 Wav2Lip 的 Python 唇形同步库,旨在简化视频和图片中人物嘴唇与音频的同步过程。它解决了传统唇形同步工具配置复杂、推理速★ 153WACV23_TSNetTSNet 是 WACV 2023 论文《Cross-identity Video Motion Retargeting with Joint Transfor★ 148vantavanta 是一个基于 Remotion 构建的开源 AI 视频引擎,旨在替代 Synthesia、HeyGen、Runway、CapCut 等商业工具。它解决★ 127xtalkerxtalker 是一个专注于在 Xeon CPU 上实现快速说话人脸动画的开源项目,旨在让数字人视频生成不再依赖昂贵 GPU。它解决了传统说话人脸生成模型推理速★ 126MaineCoonMaineCoon 是一个追求实时音视频社交世界模型的开源项目,目前处于早期技术报告与项目链接阶段。它旨在构建一个能够实时理解和生成音频与视频的生成式AI模型,★ 121Speech2VideoSpeech2Video 是一个基于 ACCV 2020 论文的开源项目,旨在从单一音频输入生成具有3D骨架正则化和丰富身体姿态的说话人视频。它解决的核心问题是★ 100Crystal.TTVSCrystal.TTVS 是一个基于 C++ 的实时多语言语音合成引擎,核心特点是配备 3D 表情化虚拟形象,实现音视频同步输出。它解决的是传统语音合成缺乏视觉★ 88