image-animation

本站收录 21 个带「image-animation」标签的 AI 开源项目

LivePortrait快手开源的人像驱动技术,让静态照片“活”起来。基于单张人像即可生成自然流畅的说话、表情与头部动作视频,广泛应用于数字人、直播互动与影视特效,效果生动逼真。★ 19,132SadTalkerSadTalker 是一个基于 CVPR 2023 论文的开源数字人项目,核心功能是输入一张静态人像照片和一段语音音频,生成逼真的说话视频。它通过学习 3D 运★ 14,108Thin-Plate-Spline-Motion-ModelThin-Plate-Spline-Motion-Model 是一个基于 CVPR 2022 论文的图像动画开源项目,核心解决从单张静态图片生成动态视频的问题。★ 3,606DynamiCrafterDynamiCrafter 是一个基于视频扩散先验的开源图像动画工具,能将静态图片转换为动态视频。它解决了开放域图像动画中运动幅度小、动态性不足的问题,通过利用★ 3,008awesome-talking-head-generation这是一个汇集了数字人/说话头生成领域最前沿技术与资源的精选列表,旨在解决该领域资料分散、入门门槛高的问题。项目按技术路线(如NeRF、3DMM、Diffusio★ 1,933MIMOMIMO 是一个可控角色视频合成框架,通过空间分解建模实现高质量的角色动画生成。它解决了现有方法在角色视频生成中运动控制不精细、背景与前景耦合导致编辑困难的问题★ 1,577sd-wav2lip-uhqsd-wav2lip-uhq 是一个为 Automatic1111 Stable Diffusion WebUI 开发的扩展,旨在将 Wav2Lip 唇形同步模★ 1,421articulated-animationarticulated-animation 是论文《Motion Representations for Articulated Animation》的官方代码★ 1,278CVPR2022-DaGANDaGAN 是 CVPR 2022 收录的论文《Depth-Aware Generative Adversarial Network for Talking H★ 997FollowYourClickFollow-Your-Click 是一个基于 AAAI 2025 论文的开源区域图像动画工具,通过简短提示词(如“挥手”“走路”)驱动静态图片中指定区域生成动★ 909JoyVASAJoyVASA 是一个基于扩散模型的数字人动画生成框架,专注于人像和动物肖像的动画化。它解决了传统动画生成中表情僵硬、动作不自然、跨物种适配困难等问题,核心能力★ 880wav2lip_288x288Wav2Lip 288x288 是一个基于 Wav2Lip 的改进版本,专注于高分辨率(288x288)的唇形同步视频生成。它解决了原始 Wav2Lip 在低分★ 651CVPR23_LFDMCVPR23_LFDM 是 CVPR 2023 论文《Conditional Image-to-Video Generation with Latent Flo★ 470Magic-MeMagic-Me 是一个基于扩散模型的个性化视频生成项目,旨在实现身份特定的视频定制化生成。它解决了现有文本到视频模型难以保持特定人物身份一致性的问题,允许用户★ 459ConSinGANConSinGAN 是单图像生成对抗网络(GAN)的 PyTorch 实现,源自论文《Improved Techniques for Training Sing★ 442physgenPhysGen 是一个基于物理模拟的图像到视频生成项目,来自 ECCV 2024。它主要解决现有图像动画方法生成的视频缺乏真实物理交互的问题,比如物体运动不符合★ 353OTAvatarOTAvatar 是一个基于 CVPR2023 论文的一次性说话人脸头像生成框架,核心目标是用单张静态人脸照片即可驱动生成可说话的 3D 头像。它通过可控的三平★ 324X-DynaX-Dyna 是一个基于扩散模型的动态人体图像动画生成工具,核心解决的是让静态人物照片“活起来”并跟随动作驱动生成自然视频的问题。它由字节跳动等机构提出,入选 ★ 268DAWN-pytorchDAWN-pytorch 是论文《Dynamic Frame Avatar with Non-autoregressive Diffusion Framewor★ 233LivePhotoLivePhoto 是论文《LivePhoto: Real Image Animation with Text-guided Motion Control》的官★ 206NeRFFaceSpeech_CodeNeRFFaceSpeech_Code 是一个基于 NeRF(神经辐射场)的 3D 说话头生成开源项目,对应 CVPRW 2024 论文。它解决的是从单张人脸图★ 63