diffusion

本站收录 146 个带「diffusion」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

stable-diffusion-webui最流行的 Stable Diffusion Web UI,通过浏览器界面运行 SD 模型,支持文生图、图生图、超分辨率、蒙版重绘等丰富功能与庞大的扩展生态,是 ★ 165,151sglangSGLang 是一个高性能的大语言模型和多模态模型服务框架,旨在解决 LLM 推理服务中吞吐量低、延迟高、显存利用率不足等问题。它通过 RadixAttenti★ 36,594diffusersHugging Face 官方出品的扩散模型工具库,基于 PyTorch,提供图像、视频、音频生成领域最先进的扩散模型,接口统一、开箱即用,是研究与生产环境中最★ 34,633peftPEFT 是一个专注于参数高效微调(Parameter-Efficient Fine-Tuning)的 Python 库,由 Hugging Face 团队维护★ 21,737leedl-tutorial《李宏毅深度学习教程》是Datawhale社区维护的开源教材,源自台湾大学李宏毅老师的深度学习课程。该项目将课程内容整理为Jupyter Notebook格式,★ 16,787easydiffusionEasy Diffusion 是一个面向普通用户的本地 AI 绘画工具,旨在让没有任何技术背景的人也能一键在个人电脑上生成艺术作品。它解决了 Stable Di★ 10,467SanaNVIDIA 开源的高效高分辨率图像合成模型,采用线性 Diffusion Transformer 架构,在保持高质量生成的同时显著降低计算开销,支持超高清图像★ 9,163loraLoRA(低秩适应)是一种高效的模型微调技术,最初由微软提出,此项目将其应用于扩散模型(如Stable Diffusion)的快速微调。它通过冻结预训练模型的权★ 7,559mmagicOpenMMLab 推出的多模态生成智能创作工具箱,提供开箱即用的 AIGC 能力、易用 API 与丰富模型库,涵盖文生图、图像/视频修复与增强等任务,是搭建生★ 7,470stable-diffusion.cpp纯 C/C++ 实现的扩散模型推理库,无需 Python 环境即可运行 SD、Flux、Wan、Qwen Image、Z-Image 等主流模型,性能卓越、部署★ 7,469vllm-omni面向全模态模型的统一高效推理框架,支持文本、图像、视频、音频等多种模态的高性能推理,延续 vLLM 的工程优势,为多模态大模型应用提供稳定快速的部署方案。★ 7,135transformerlab-appTransformer Lab 是一个面向 AI 研究者的开源研究环境,旨在让模型训练、评估和扩展变得无缝流畅,支持从本地硬件到 GPU 集群的灵活部署。它解决★ 5,195tiny-universetiny-universe 是一个以 Jupyter Notebook 形式呈现的大模型教学项目,旨在通过从零手搓的方式,帮助学习者深入理解大模型的内部工作原理★ 5,080OmniGenOmniGen 是一个统一图像生成框架,基于扩散模型,通过单一模型实现文生图、图像编辑、多图融合、角色一致性生成等多种任务,无需额外模块或复杂pipeline。★ 4,345riffusion-hobbyriffusion-hobby 是一个基于 Stable Diffusion 的音乐生成开源项目,将图像生成技术应用于音频频谱图,实现实时音乐创作。它解决了传统★ 3,900discoartdiscoart 是一个用 Python 编写的开源工具,旨在通过一行代码简化 Disco Diffusion 艺术作品的创作流程。Disco Diffusio★ 3,822MuseVMuseV 是一个基于扩散模型的开源虚拟人视频生成框架,专注于生成无限长度、高保真的虚拟人视频。它解决了传统视频生成中时长受限、动作不连贯、身份不一致等问题,核★ 2,843Kandinsky-2Kandinsky-2 是一个多语言文本生成图像(text2image)的潜在扩散模型,由俄罗斯团队开发。它解决了现有文本到图像模型对英文支持良好但多语言能力不★ 2,811InfiniteYouInfiniteYou 是一个基于扩散模型的图像生成与编辑工具,核心解决身份保持下的灵活照片重绘问题。它允许用户在不丢失人物身份特征的前提下,对照片进行多种编辑★ 2,683riffusion-app-hobbyriffusion-app-hobby 是一个基于 Stable Diffusion 的实时音乐生成 Web 应用,将图像生成模型应用于音频频谱图,实现从文本或★ 2,670Awesome-Video-Diffusion-Models这是一个关于视频扩散模型的精选资源列表,源自一篇发表在《计算机科学与技术评论》(CSUR)上的综述论文。项目系统梳理了视频扩散模型领域的核心研究,包括模型架构、★ 2,318awesome-diffusion-categorized这是一个精选扩散模型论文的合集,按子领域分类整理,旨在帮助研究者和开发者快速定位特定方向的学术资源。项目解决了扩散模型论文数量庞大、检索困难的问题,通过系统化的★ 2,224HeliosHelios 是一个专注于实时长视频生成的扩散模型开源项目,旨在解决当前视频生成模型推理速度慢、生成时长受限的问题。它支持图像到视频(image-to-vide★ 2,176LlamaGenLlamaGen 是一个基于自回归模型的可扩展图像生成项目,其核心主张是自回归模型在图像生成任务上可以超越扩散模型。它借鉴了大型语言模型(LLM)的成功经验,将★ 1,966fastRAGfastRAG是一个专注于高效检索增强生成(RAG)的开源框架,旨在解决企业落地RAG时面临的性能瓶颈和部署复杂性问题。它基于Haystack构建,但针对生产环★ 1,787BrushNetBrushNet 是一个即插即用的图像修复(inpainting)模型,基于分解双分支扩散架构,论文发表于 ECCV 2024。它解决现有扩散模型在图像修复时难★ 1,744opendreamopendream 是一个可扩展、易用且便携的扩散模型 Web UI,旨在简化 Stable Diffusion 等图像生成模型的使用流程。它解决了传统 Web★ 1,669AngelSlimAngelSlim 是一个面向大语言模型的开源压缩工具包,旨在让模型压缩更易用、更全面、更高效。它解决了模型部署中体积大、推理慢、成本高的问题,提供从剪枝、量化★ 1,668mlx-servemlx-serve 是一个专为 Apple Silicon 设计的原生 LLM 推理服务器,使用 Zig 语言编写,无需 Python 环境。它兼容 OpenA★ 1,665sd-akashicsd-akashic 是一个关于 Stable Diffusion 的信息大全,旨在为 SD 用户提供系统化、结构化的知识库。它解决了 Stable Diffu★ 1,630fantasy-talkingFantasyTalking 是一个面向数字人领域的 3D 说话人像生成框架,由 ACM MM 2025 收录。它解决的是传统说话人像生成中头部运动与表情不协调★ 1,630UNOUNO 是一个基于扩散 Transformer 的图像生成定制化方法,由清华大学提出,论文发表于 ICCV 2025。它解决的是当前定制化生成模型只能处理单主体★ 1,363sd-webui-inpaint-anythingsd-webui-inpaint-anything 是一个基于 Stable Diffusion WebUI 的扩展,它将 Segment Anything 的★ 1,295tangotango 是一个用于文本生成音频的扩散模型家族,旨在解决从文字描述直接合成高质量音频的问题。它基于文本提示生成对应的音频内容,如音效、环境声等,核心能力包括文★ 1,241Stable-Diffusion-NCNNStable-Diffusion-NCNN 是一个基于 C++ 和 NCNN 推理框架的 Stable Diffusion 轻量级实现,支持在移动端(如 And★ 1,069Causal-ForcingCausal-Forcing 是 ICML 2026 论文的官方代码库,提出了一种自回归扩散模型的蒸馏方法,旨在实现高质量、实时的交互式视频生成。它解决了传统扩★ 983FireRedTTSFireRedTTS 是一个基于大语言模型(LLM)的开源语音合成(TTS)系统,旨在提供高质量、自然且可控的文本到语音生成能力。它结合了语言模型、扩散模型、流★ 926ConsisIDConsisID 是一个面向身份保持的文本到视频生成模型,由 CVPR 2025 Highlight 论文提出。它解决的是在视频生成中,如何根据文本描述生成指定★ 862Omega-AIOmega-AI 是一个基于 Java 的深度学习框架,目标是让 Java 开发者无需切换到 Python 生态,就能直接构建、训练和推理神经网络。它内置自动微★ 855kandinsky-5Kandinsky 5.0 是一个基于扩散模型的视频与图像生成项目,旨在提供高质量的多模态生成能力。它解决了从文本到视频和图像的统一生成问题,支持文本到视频、文★ 829DiT-ExtrapolationDiT-Extrapolation 是 ICML 2025 论文《RIFLEx: A Free Lunch for Length Extrapolation i★ 829rcmrCM(Rectified Consistency Models)是一个专注于视频扩散模型蒸馏的开源项目,旨在将大规模视频扩散模型转化为少步生成模型,实现双向和★ 814Autoregressive-Models-in-Vision-Survey这是一份关于视觉自回归模型(AR models)的综述论文项目,发表于TMLR 2025。它系统梳理了自回归模型在计算机视觉领域的研究进展,涵盖图像生成、视频预★ 808daamDAAM(Diffusion Attentive Attribution Maps)是一个用于解释Stable Diffusion模型内部机制的可解释性AI工具★ 803stable-diffusion-dockerstable-diffusion-docker 是一个将官方 Stable Diffusion 模型封装进 Docker 容器的项目,旨在简化 Stable D★ 743Flow-FactoryFlow-Factory 是一个面向 Flow-Matching 模型的统一强化学习框架,旨在简化基于流匹配的生成模型(如扩散模型)中的强化学习训练流程。它解决★ 712SkyPaint-AI-DiffusionSkyPaint-AI-Diffusion 是一个基于 Stable Diffusion 优化的中文 AI 绘画模型,旨在解决中文用户使用文本生成图像时提示词理★ 646paint-with-words-sd这是一个基于Stable Diffusion的文本引导图像生成工具,实现了eDiff-I论文中的Paint-with-words方法。它允许用户通过文本标签化的★ 645blended-latent-diffusionBlended Latent Diffusion 是 SIGGRAPH 2023 论文的官方实现,用于文本驱动的图像局部编辑。它解决的是传统扩散模型在编辑图像时★ 631stable-diffusion-pytorch这是一个用PyTorch从零实现的Stable Diffusion开源项目,代码结构清晰、注释友好,旨在帮助开发者理解扩散模型的内部原理。它解决了官方实现代码复★ 595