diffusion-model

本站收录 32 个带「diffusion-model」标签的 AI 开源项目

DiffSingerDiffSinger 是一个基于浅层扩散机制的开源歌声合成(SVS)与语音合成(TTS)项目,源自 AAAI 2022 论文,官方代码实现。它解决的核心问题是传★ 4,864awesome-diffusion-categorized这是一个精选扩散模型论文的合集,按子领域分类整理,旨在帮助研究者和开发者快速定位特定方向的学术资源。项目解决了扩散模型论文数量庞大、检索困难的问题,通过系统化的★ 2,224HeliosHelios 是一个专注于实时长视频生成的扩散模型开源项目,旨在解决当前视频生成模型推理速度慢、生成时长受限的问题。它支持图像到视频(image-to-vide★ 2,176Matcha-TTSMatcha-TTS 是一个基于条件流匹配(Conditional Flow Matching)的快速文本转语音(TTS)架构,发表于 ICASSP 2024。★ 1,362MotusMotus 是一个统一潜在动作世界模型,用于视频生成和机器人操作。它基于扩散模型,将视觉、语言和动作融合到一个潜在空间中,通过预测未来的视频帧来学习世界的动态规★ 1,297MotionDiffuseMotionDiffuse 是一个基于扩散模型的文本驱动人体运动生成框架,旨在解决从自然语言描述直接生成高质量3D人体动画的问题。它通过将文本编码器与去噪扩散模★ 984SEINESEINE 是一个基于扩散模型的视频生成工具,专注于短片段到长视频的生成,以及视频之间的平滑过渡。它解决了现有视频生成模型难以生成连贯长视频和实现视频间自然转场★ 966TF-ICONTF-ICON 是一个基于扩散模型的免训练跨域图像合成工具,由 ICCV 2023 论文官方实现。它解决的是将不同来源、不同风格的图像(如真实照片与艺术画作)自★ 815motion-latent-diffusionmotion-latent-diffusion 是一个基于潜在空间运动扩散模型的开源项目,发表于 CVPR 2023。它旨在解决文本或动作指令到人体运动生成的任★ 747Flow-FactoryFlow-Factory 是一个面向 Flow-Matching 模型的统一强化学习框架,旨在简化基于流匹配的生成模型(如扩散模型)中的强化学习训练流程。它解决★ 712AlayaRendererAlayaRenderer 是一个面向游戏和虚拟世界的生成式世界渲染器,定位为 AI 原生渲染管线。它利用扩散模型和 G-buffer 技术,将传统渲染流程与视★ 689DiffusionFastForwardDiffusionFastForward 是一个面向扩散生成模型的开源课程与实验框架,旨在帮助学习者和开发者快速上手扩散模型。项目以 Jupyter Noteb★ 685ReVersionReVersion 是 SIGGRAPH Asia 2024 的官方实现,专注于从少量图像中反转(invert)物体间的关系,并用于图像生成。它解决了文本到图像★ 502PnPInversionPnPInversion 是 ICLR 2024 的官方实现,提出一种仅需三行代码即可增强扩散模型编辑能力的方法。它解决现有基于扩散模型的图像编辑中,编辑结果与★ 4131Prompt1Story1Prompt1Story 是一个基于扩散模型的文本到图像生成工具,由 ICLR 2025 Spotlight 论文提出。它解决的核心问题是:在生成多张相关图像★ 322Kiss3DGenKiss3DGen 是一个基于 CVPR 2025 论文的官方实现,旨在复用图像扩散模型来生成 3D 资产。它解决了传统 3D 生成方法需要大量 3D 训练数据★ 298LAMPLAMP 是一个基于扩散模型的少样本视频生成框架,发表于 CVPR 2024。它旨在解决视频生成中数据稀缺和运动模式学习困难的问题,通过从少量参考视频中学习可迁★ 284CFGppCFGpp 是 ICLR2025 论文《CFG++: manifold-constrained classifier free guidance for dif★ 245Awesome-Efficient-AIGCAwesome-Efficient-AIGC 是一个专注于高效 AIGC(人工智能生成内容)领域的精选资源列表,收录了相关论文、文档和代码。该项目旨在为高效 A★ 209GMFlowGMFlow 是一个基于高斯混合流匹配(Gaussian Mixture Flow Matching)的生成模型开源实现,由 ICML 2025 论文提出。它旨★ 198MikuDanceMikuDance 是一个基于扩散模型的角色动画生成工具,专注于将静态角色艺术图(如插画、立绘)转化为动态视频。它解决了传统角色动画制作中动作僵硬、细节丢失、需★ 186DAEDALDAEDAL 是一个针对扩散大语言模型(DLLM)的训练无关可变长度去噪框架,由 ICLR 2026 论文官方开源。扩散模型通常只能生成固定长度的序列,这限制了★ 175DreamWaltz-GDreamWaltz-G 是一个基于 3D 高斯泼溅(3D Gaussian Splatting)的数字化身生成框架,由 TPAMI 2025 论文官方实现。它★ 158DiffusionTexturePaintingDiffusionTexturePainting 是 SIGGRAPH 2024 上发布的一个开源项目,专注于利用扩散模型进行纹理绘制。它解决的是传统纹理映射中★ 126PrimDiffusionPrimDiffusion 是一个基于扩散模型的 3D 人体生成框架,核心创新在于使用体素化基元(Volumetric Primitives)作为 3D 表示,★ 119FridoFrido 是一个基于特征金字塔扩散模型的图像生成研究项目,源自论文《Frido: Feature Pyramid Diffusion for Complex ★ 114Awesome-Diffusion-LLMAwesome-Diffusion-LLM 是一个精选论文列表,专注于大型语言扩散模型(Large-Language-Diffusion-Models)这一前沿★ 103Awesome-Controllable-Video-Diffusion这是一个关于可控视频生成的精选资源列表,汇集了基于扩散模型的视频生成与控制技术。它系统整理了相关论文、代码和工具,覆盖了从运动控制、内容编辑到条件生成等多个方向★ 60LeapAlign_CodeLeapAlign 是一个针对流匹配(Flow Matching)图像生成模型的训练后优化方法,核心目标是让模型在任意生成步数下都能保持高质量输出。传统扩散或流★ 58Guide-and-RescaleGuide-and-Rescale 是一个无需微调(tuning-free)的真实图像编辑工具,基于扩散模型实现。它解决的是文本引导图像编辑中常见的编辑过度或不★ 54GenHowToGenHowTo 是 CVPR 2024 论文的官方代码实现,专注于从教学视频中学习生成动作和状态转换。它解决的是如何让 AI 理解视频中的操作步骤,并生成可执★ 54LSRNALSRNA 是一个基于扩散模型的潜在空间超分辨率方法,旨在解决扩散模型生成高分辨率图像时计算成本高、细节不足的问题。它通过在潜在空间中进行超分辨率处理,而非在像★ 51