diffusion-models

本站收录 367 个带「diffusion-models」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

Hunyuan3D-2Hunyuan3D-2 是腾讯开源的高分辨率 3D 资产生成模型,基于大规模扩散模型架构,能够从单张图片或文本描述直接生成高质量、带纹理的 3D 网格模型。它解★ 14,993HunyuanVideo腾讯混元出品的大规模视频生成模型系统框架,从数据、模型到训练全面优化,支持高质量文生视频,画面细腻、语义对齐准确,为开源视频生成领域树立了重要标杆。★ 12,576LTX-VideoLightricks 官方开源的 LTX-Video 视频生成模型仓库,基于 DiT 架构实现高质量文生视频与图生视频,支持实时生成与可控编辑,为视频创作者提供★ 10,995openvinoOpenVINO 是英特尔开源的 AI 推理优化与部署工具包,旨在帮助开发者将训练好的深度学习模型(如 PyTorch、TensorFlow、ONNX 等格式)★ 10,935runanywhere-sdksrunanywhere-sdks 是一个面向生产环境的 C++ 工具包,旨在让 AI 模型在本地设备上高效运行。它解决了云端推理带来的延迟、隐私和成本问题,提供★ 10,318VARNeurIPS 2024 最佳论文奖的官方实现,提出视觉自回归建模(VAR),通过下一尺度预测生成图像,以超简单易用的方式达到超越扩散模型的最新效果,并揭示了视★ 8,733mmagicOpenMMLab 推出的多模态生成智能创作工具箱,提供开箱即用的 AIGC 能力、易用 API 与丰富模型库,涵盖文生图、图像/视频修复与增强等任务,是搭建生★ 7,470StyleTTS2StyleTTS 2 通过风格扩散与对抗训练,结合大型语音语言模型,实现了接近人类水平的文本转语音。合成语音的自然度与韵律表现力出众,即使无参考语音也能生成高质★ 6,361Awesome-Video-DiffusionAwesome-Video-Diffusion 是一个精心整理的视频扩散模型资源列表,聚焦于视频生成、编辑及相关应用。项目将近年来涌现的扩散模型按用途分类收录,★ 5,789remove-ai-watermarks这是一个用于移除AI生成图像水印的命令行工具和Python库,主要针对Google Gemini(Nano Banana)的可见星标水印、SynthID隐形水印★ 5,716SUPIRSUPIR 是一个面向真实世界图像修复的开源项目,旨在通过深度学习算法将低质量、模糊或有噪声的照片恢复为高分辨率、逼真的图像。它基于 Stable Diffus★ 5,673transformerlab-appTransformer Lab 是一个面向 AI 研究者的开源研究环境,旨在让模型训练、评估和扩展变得无缝流畅,支持从本地硬件到 GPU 集群的灵活部署。它解决★ 5,195PyTorch-Tutorial-2nd《PyTorch实用教程》(第二版)是一份面向深度学习工程师的开源教程,以Jupyter Notebook形式呈现。它系统覆盖了从PyTorch基础语法、张量操★ 4,610FastVideo统一的视频生成加速框架,将推理与后训练(post-training)流程整合一体,通过高效优化实现更快的视频生成速度,降低训练与推理成本,适合研究团队与工程部署★ 4,521ComfyUI-LTXVideoComfyUI-LTXVideo 是 ComfyUI 的官方插件,用于集成 LTX-Video 视频生成模型。LTX-Video 是 Lightricks 推出★ 4,146nunchakununchaku 是 ICML 2025 Spotlight 论文 SVDQuant 的官方开源实现,专注于 4-bit 扩散模型的量化推理与微调。它通过低秩组★ 3,958TurboDiffusion面向视频扩散模型的极致加速方案,通过蒸馏与优化实现 100~200 倍推理加速,在保持生成质量的同时大幅缩短出片时间,让高质量视频生成从离线走向实时成为可能。★ 3,850MAGI-1自回归视频生成大模型 MAGI-1,采用规模化自回归范式直接生成视频,无需扩散过程,在长视频生成与效率上展现出独特优势,为视频生成技术路线提供了全新选择。★ 3,791Diffusion-Models-Papers-Survey-Taxonomy扩散模型论文、综述与分类体系的精选资料库,系统梳理扩散模型领域的研究脉络与分类框架,是快速入门与持续跟踪该领域进展的必备导航工具。★ 3,364Pyramid-FlowPyramid-Flow 是一个基于流匹配的高效视频生成开源项目,由快手科技提出,论文发表于 ICLR 2025。它针对现有视频扩散模型推理速度慢、计算成本高的★ 3,212awesome-speech-recognition-speech-synthesis-papers这是一个收录语音识别与语音合成领域经典论文的精选列表,涵盖自动语音识别(ASR)、说话人验证、语音合成、文本转语音(TTS)、语言建模、歌声合成(SVS)和声音★ 3,132DreamCraft3DDreamCraft3D 是一个由 ICLR 2024 收录的官方实现项目,专注于从单张 2D 图像生成高质量 3D 模型。它采用分层生成策略,结合引导扩散先验★ 3,028SimpleTunerSimpleTuner 是一个面向扩散模型的通用微调工具包,支持图像、视频和音频扩散模型的定制训练。它解决了扩散模型在特定数据集上微调时配置复杂、流程繁琐的问题★ 2,930LightX2VLightX2V 是一个轻量级的图像到视频(I2V)动作生成推理框架,专注于降低视频生成模型的使用门槛。它解决了现有视频生成工具依赖复杂环境、推理速度慢、资源占★ 2,867MimicMotionMimicMotion 是一个高质量人体运动视频生成工具,基于扩散模型,通过置信度感知的姿态引导来生成逼真的人物动作视频。它解决了传统姿态驱动视频生成中动作不自★ 2,668Awesome-Video-Diffusion-Models这是一个关于视频扩散模型的精选资源列表,源自一篇发表在《计算机科学与技术评论》(CSUR)上的综述论文。项目系统梳理了视频扩散模型领域的核心研究,包括模型架构、★ 2,318awesome-diffusion-categorized这是一个精选扩散模型论文的合集,按子领域分类整理,旨在帮助研究者和开发者快速定位特定方向的学术资源。项目解决了扩散模型论文数量庞大、检索困难的问题,通过系统化的★ 2,224HeliosHelios 是一个专注于实时长视频生成的扩散模型开源项目,旨在解决当前视频生成模型推理速度慢、生成时长受限的问题。它支持图像到视频(image-to-vide★ 2,176Awesome-LM-SSPAwesome-LM-SSP 是一个聚焦大模型安全、隐私与可信度的精选阅读清单,收录了相关论文、工具、数据集和攻击防御方法。它系统梳理了提示注入、越狱攻击、隐私★ 2,081Show-oShow-o 是一个基于单一 Transformer 架构的统一多模态模型,旨在同时处理视觉与文本的理解与生成任务。传统上,视觉理解和生成通常由不同模型或复杂组★ 1,979LlamaGenLlamaGen 是一个基于自回归模型的可扩展图像生成项目,其核心主张是自回归模型在图像生成任务上可以超越扩散模型。它借鉴了大型语言模型(LLM)的成功经验,将★ 1,966onediffOneDiff 是一个开箱即用的扩散模型加速库,专门针对 Stable Diffusion 等图像生成模型进行推理优化。它解决了扩散模型生成速度慢、部署成本高的★ 1,965Make-It-3DMake-It-3D 是 ICCV 2023 收录的论文官方实现,旨在从单张 2D 图像生成高质量、高保真的 3D 模型。它解决了传统 3D 内容创建依赖多视角★ 1,900dpm-solverDPM-Solver 是 NeurIPS 2022 Oral 论文的官方实现,针对扩散概率模型(DPM)采样速度慢的问题,提出了一种基于常微分方程(ODE)的高★ 1,857RAG-SurveyRAG-Survey 是一个系统整理检索增强生成(RAG)领域论文的精选列表,由腾讯 AI Lab 团队维护,并基于其发表的综述论文《Retrieval-Aug★ 1,789BrushNetBrushNet 是一个即插即用的图像修复(inpainting)模型,基于分解双分支扩散架构,论文发表于 ECCV 2024。它解决现有扩散模型在图像修复时难★ 1,744fantasy-talkingFantasyTalking 是一个面向数字人领域的 3D 说话人像生成框架,由 ACM MM 2025 收录。它解决的是传统说话人像生成中头部运动与表情不协调★ 1,630Magic123Magic123 是一个由 ICLR'24 收录的官方 PyTorch 实现,专注于从单张图像生成高质量 3D 物体。它解决了传统单图 3D 重建中几何细节缺失★ 1,624MIMOMIMO 是一个可控角色视频合成框架,通过空间分解建模实现高质量的角色动画生成。它解决了现有方法在角色视频生成中运动控制不精细、背景与前景耦合导致编辑困难的问题★ 1,577Generative_Deep_Learning_2nd_Edition这是 O'Reilly 出版的《Generative Deep Learning》第二版的官方代码仓库,旨在通过 Jupyter Notebook 教程,帮助读★ 1,561LanPaintLanPaint 是一个面向 Stable Diffusion 系列模型的免训练图像修复(inpainting)方案,同时提供 ComfyUI 自定义节点。它要★ 1,416TeaCacheTeaCache 是一个面向视频扩散模型的推理加速工具,通过缓存时间步嵌入来跳过冗余计算,从而在不明显损失生成质量的前提下大幅提升视频生成速度。它解决了视频扩散★ 1,382FireRed-Image-EditFireRed-Image-Edit 是一个开源的图像编辑基础模型,旨在解决现有图像编辑工具在指令遵循、生成保真度和身份一致性上的不足。它基于扩散模型架构,支持★ 1,375Irodori-TTSIrodori-TTS 是一个基于 Flow Matching 的文本转语音(TTS)模型,特色在于通过表情符号(emoji)驱动风格控制。它解决了传统 TTS★ 1,363Matcha-TTSMatcha-TTS 是一个基于条件流匹配(Conditional Flow Matching)的快速文本转语音(TTS)架构,发表于 ICASSP 2024。★ 1,362CrossAttentionControlCrossAttentionControl 是论文《Prompt-to-Prompt Image Editing with Cross Attention Co★ 1,338MagicTimeMagicTime 是一个专注于生成延时摄影视频的开源项目,核心能力是将文本描述转化为自然演变过程的延时视频,例如花朵绽放、冰雪融化、云卷云舒等。它基于扩散模型★ 1,337Hunyuan3D-2-WinPortableHunyuan3D-2-WinPortable 是腾讯混元3D 2.0/2.1模型的Windows便携整合包,旨在解决官方模型在Windows环境下部署复杂、依★ 1,335prunaPruna 是一个面向开发者的模型优化框架,旨在以最小的工作量让 AI 模型运行得更快、更高效。它主要解决深度学习模型在推理阶段的性能瓶颈问题,通过组合多种优化★ 1,303Paint-by-ExamplePaint-by-Example 是一个基于扩散模型的图像编辑工具,通过给定示例图像,实现对输入图像的语义编辑,如替换物体、改变风格等。它解决了传统图像编辑需要★ 1,252