text2image
本站收录 50 个带「text2image」标签的 AI 开源项目
stable-diffusion-webui最流行的 Stable Diffusion Web UI,通过浏览器界面运行 SD 模型,支持文生图、图生图、超分辨率、蒙版重绘等丰富功能与庞大的扩展生态,是 ★ 165,151
diffusersHugging Face 官方出品的扩散模型工具库,基于 PyTorch,提供图像、视频、音频生成领域最先进的扩散模型,接口统一、开箱即用,是研究与生产环境中最★ 34,633
banana-slidesbanana-slides 是一个基于 nano banana pro 模型的原生 AI PPT 生成应用,主打“Vibe PPT”体验。它解决传统 PPT 制★ 15,671
StabilityMatrixStabilityMatrix 是一个跨平台的 Stable Diffusion 包管理器,主要解决 AI 绘画用户在多环境、多版本、多工具之间切换和管理的痛点★ 8,854
mmagicOpenMMLab 推出的多模态生成智能创作工具箱,提供开箱即用的 AIGC 能力、易用 API 与丰富模型库,涵盖文生图、图像/视频修复与增强等任务,是搭建生★ 7,470
stable-diffusion.cpp纯 C/C++ 实现的扩散模型推理库,无需 Python 环境即可运行 SD、Flux、Wan、Qwen Image、Z-Image 等主流模型,性能卓越、部署★ 7,469
Kandinsky-2Kandinsky-2 是一个多语言文本生成图像(text2image)的潜在扩散模型,由俄罗斯团队开发。它解决了现有文本到图像模型对英文支持良好但多语言能力不★ 2,811
VQGAN-CLIPVQGAN-CLIP 是一个将 VQGAN 与 CLIP 模型结合用于本地文本生成图像的开源项目。它解决了用户需要依赖 Google Colab 等云端环境才能★ 2,643
LlamaGenLlamaGen 是一个基于自回归模型的可扩展图像生成项目,其核心主张是自回归模型在图像生成任务上可以超越扩散模型。它借鉴了大型语言模型(LLM)的成功经验,将★ 1,966
voltaML-fast-stable-diffusionVoltaML 是一个基于 Stable Diffusion 的 WebUI,旨在提供美观且易用的图像生成界面。它解决了 Stable Diffusion 原生★ 997
unpromptedunprompted 是一个专为 Stable Diffusion 工作流设计的模板语言,以 Automatic1111 WebUI 扩展形式提供。它解决的是在★ 807
stable-diffusion-aesthetic-gradientsstable-diffusion-aesthetic-gradients 是一个基于 Stable Diffusion 的个性化微调工具,通过美学梯度(Aest★ 743
SkyPaint-AI-DiffusionSkyPaint-AI-Diffusion 是一个基于 Stable Diffusion 优化的中文 AI 绘画模型,旨在解决中文用户使用文本生成图像时提示词理★ 646
Text2LightText2Light 是 SIGGRAPH Asia 2022 发表的零样本文本驱动 HDR 全景图生成模型。它解决的是从文本描述直接生成高质量、高动态范围(H★ 628
ComfyUI-DyPEComfyUI-DyPE 是为 ComfyUI 提供 DyPE 与 SEGA 两种采样增强技术的自定义节点插件,目标是让文生图模型在 4K 及以上分辨率下生成时★ 627
AmazingZImageWorkflowAmazingZImageWorkflow 是一个为 ComfyUI 设计的 Z-Image 工作流项目,旨在提供高质量图像生成和友好的用户体验。它解决了 Z-★ 505
CLIP-Guided-Diffusion这是一个将CLIP模型与扩散模型结合,实现文本引导图像生成的实验性项目。它解决了用户需要依赖Google Colab等在线环境才能运行CLIP Guided D★ 385
ComfyUI-ZImagePowerNodesComfyUI-ZImagePowerNodes 是一组专门为 Z-Image 和 Z-Image Turbo 模型设计的 ComfyUI 自定义节点。它解决了★ 364
DyPEDyPE 是 ICML 2026 论文的官方实现,针对扩散模型在超高分辨率图像生成中的位置编码外推难题,提出动态位置外推方法。现有模型(如 Flux)在训练分辨★ 361
open-museopen-muse 是 Google MUSE 模型的开放复现项目,旨在实现快速文本到图像生成。MUSE 是一种基于 transformer 的文本条件图像生成★ 360
stable-diffusion-colabstable-diffusion-colab 是一个基于 Google Colab 的 Jupyter Notebook 项目,专门用于运行 Stable Di★ 322
diffusers-interpretDiffusers-Interpret 是一个面向 Hugging Face Diffusers 模型的可解释性工具库,旨在帮助开发者和研究者理解扩散模型生成图★ 277
tiny-dreamTiny Dream 是一个嵌入式、仅头文件的 Stable Diffusion C++ 实现,旨在将强大的文生图模型压缩到资源受限的设备上运行。它解决了传统 ★ 269
onnx-webonnx-web 是一个基于 Web 的图形界面,用于运行 GPU 加速的 ONNX 推理管线,特别针对 Stable Diffusion 等图像生成模型。它解★ 233
arbitrary-text-to-image-papers这是一个持续更新的论文列表,系统梳理了任意文本到图像生成领域的学术资源。项目按技术路线分类整理,涵盖基于GAN、场景图、对话交互等不同范式的论文,并为每篇论文附★ 210
CDCDCDCD是一个跨模态音乐与图像生成的学术研究项目,发表于ICLR 2023。它提出了一种离散对比扩散模型,旨在解决音乐和图像之间跨模态生成的问题。核心能力包括:★ 163
clip-genCLIP-GEN 是一个基于 CLIP 的文本生成图像模型,核心创新在于无需语言标注训练。传统文本到图像模型依赖大量图文配对数据,而 CLIP-GEN 利用 C★ 147
template-repotemplate-repo 是一个基于 Rust 的智能体编排与安全模板项目,旨在为开发者提供构建、部署和保护 AI 代理的参考框架。它解决了多代理协作中的信任★ 132
LightGenLightGen 是一个高效的文本到图像生成预训练流水线,专注于解决图像生成模型训练成本高、效率低的问题。它结合了自回归模型和扩散模型的优势,提供了一套完整的预★ 132
phramephrame 是一个基于 AI 的数字相框应用,它能够将用户的语音对话转化为独特且引人入胜的艺术作品。该项目旨在解决传统数字相框内容单一、缺乏个性化和互动性的问★ 129
StableDiffusionUIStableDiffusionUI 是一个基于 Python 和 C# 构建的 Windows 桌面应用,旨在为 Stable Diffusion 模型提供简洁★ 127
StableDiffusion.NETStableDiffusion.NET 是一个面向 C# 开发者的 Stable Diffusion 封装库,基于 stable-diffusion.cpp 实★ 118
text2image-benchmarktext2image-benchmark 是一个用于生成式图像模型的基准测试工具,专注于文本到图像生成任务。它解决了生成模型评估标准不统一、指标计算复杂的问题,★ 110
yasd-discord-botyasd-discord-bot 是一个基于 Python 的 Discord 机器人,旨在将 Stable Diffusion 图像生成能力无缝集成到 Dis★ 110
vqgan-clip-appvqgan-clip-app 是一个基于 Python 的本地图像生成工具,利用 VQGAN-CLIP 或 CLIP 引导扩散模型,将文本描述转化为图像。它解决★ 100
awesome-nano-banana这是一个由 SuperMaker AI 团队维护的精选资源合集,专注于“nano banana”这一特定主题。项目汇集了策略、用例和教程,旨在帮助用户全面理解和★ 100
AudioTokenAudioToken 是一个基于扩散模型的音频到图像生成工具,源自 InterSpeech 2023 论文。它解决了仅凭文本描述难以准确捕捉音频中情感、节奏等抽★ 90
time-diffusiontime-diffusion 是论文《Editing Implicit Assumptions in Text-to-Image Diffusion Model★ 89
stable-diffusion-API这是一个非官方的 Stable Diffusion API 实现,基于 FastAPI 构建,旨在为 Stable Diffusion 模型提供便捷的 HTTP★ 82
VQGAN-CLIP-DockerVQGAN-CLIP-Docker 是一个将 VQGAN 与 CLIP 模型结合并容器化的开源项目,旨在实现零样本(zero-shot)文本到图像的生成。它解决★ 77
stable-diffusionstable-diffusion 是一个用纯 Go 语言实现的 Stable Diffusion 推理库,支持跨平台运行。它基于 ggml 张量库,无需依赖 P★ 73
com.doji.diffusers这是一个Unity包,用于通过Unity Sentis在Unity引擎中运行预训练的扩散模型(如Stable Diffusion)。它解决了在Unity环境中直★ 66
stable-diffusion-keras-ft这是一个基于Keras和TensorFlow的Stable Diffusion微调工具,旨在让开发者无需深入理解扩散模型内部细节,即可用自定义数据集对预训练的S★ 64
comfyui-workflow-versatile这是一个通用的 ComfyUI 工作流模板,旨在覆盖常见的图像生成需求。它解决了 ComfyUI 用户从零搭建复杂工作流的痛点,将文生图、图生图、局部重绘、扩图★ 63
Rickrolling-the-Artist这是一个针对文本引导图像生成模型(如Stable Diffusion)的后门攻击研究项目,源自ICCV 2023论文。它解决了生成模型被恶意篡改的安全问题:攻击★ 63
KMM-Stable-DiffusionKMM-Stable-Diffusion 是一个基于 Kotlin Multiplatform 和 Compose Multiplatform 的跨平台应用,利★ 60
textboostTextBoost 是一个面向文本到图像模型的个性化微调工具,核心解决单张参考图即可实现主体定制化生成的问题。传统方法如 DreamBooth 需要多张图像并微★ 57
QintiQinti 是一个面向专业用户的 AI 图像生成前端工具,主打易用性、多功能性和强大能力,并打包为即点即用的可执行程序。它解决了 Stable Diffusio★ 51
LightDiffusion-NextLightDiffusion-Next 是一个专注于扩散模型推理性能优化的开源项目,旨在提供最快的 Diffusion 后端、WebUI 和服务器。它解决的是扩★ 51