text-to-image

本站收录 272 个带「text-to-image」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

Open-Generative-AI不受限制的开源 AI 图像与视频生成平台,集成 Flux、Midjourney、Kling、Sora、Veo 等 500+ 模型,无内容过滤、可自托管,MIT ★ 29,398Toonflow-app开源的一站式 AI 短剧创作工具,可将小说、剧本快速转化为动画短剧,集成 AI 编剧、智能分镜、角色与视频生成等能力,跨平台桌面端轻量部署,助力创作者低成本批量★ 16,224DALLE2-pytorchDALLE2-pytorch 是 OpenAI 的 DALL-E 2 文本生成图像模型的非官方 PyTorch 实现,由开发者 lucidrains 维护。它解★ 11,300imagen-pytorch谷歌 Imagen 文生图模型的 PyTorch 实现,忠实还原其扩散模型架构与超分辨率能力,代码清晰、易于扩展,是研究文生图技术原理与二次开发的优质开源参考。★ 8,429awesome-gpt4o-images这是一个精选的GPT-4o及gpt-image-1生成图像与提示词的集合仓库,旨在展示OpenAI最新图像生成能力。项目收集了包括吉卜力风格、动漫、卡通等多种风★ 8,157Dreambooth-Stable-DiffusionDreambooth-Stable-Diffusion 是 Dreambooth 论文的 Stable Diffusion 实现,旨在解决文本到图像模型中特定主★ 7,731Awesome-Prompt-Engineering这是一个精选的提示工程(Prompt Engineering)资源列表,专注于GPT、ChatGPT、PaLM等生成式预训练模型。项目整理了从基础概念到高级技巧★ 6,347DALLE-pytorchDALLE-pytorch 是 OpenAI 文本生成图像模型 DALL-E 的 PyTorch 非官方实现,旨在复现其核心架构与训练流程。该项目解决的是研究者★ 5,625GPT-Image2-SkillGPT-Image2-Skill 是一个围绕 OpenAI GPT Image 2 模型打造的开源工具集,集提示词画廊、提示词库、Agent 技能和命令行工具于★ 5,599RedInkRedInk 是一个基于 Nano Banana Pro 模型的一站式小红书图文生成器。它解决的是小红书创作者在内容制作中面临的文案与配图分离、效率低下的问题。★ 5,596deep-dazedeep-daze 是一个基于 OpenAI CLIP 和 Siren 隐式神经表示网络的命令行工具,用于将文本描述转化为图像。它解决了文本到图像生成中语义对齐★ 4,314ComfyUI-LTXVideoComfyUI-LTXVideo 是 ComfyUI 的官方插件,用于集成 LTX-Video 视频生成模型。LTX-Video 是 Lightricks 推出★ 4,146PromptEnhancerPromptEnhancer 是一个提示词重写工具,旨在将用户输入的图像生成提示词优化为更清晰、结构化的版本,从而提升生成图像的质量。它基于视觉语言模型(VLM★ 3,779awesome-generative-ai这是一个精心整理的生成式AI资源清单,汇总了工具、模型、论文和参考链接,覆盖ChatGPT、Midjourney、DALL-E等主流技术。它解决了AI领域信息过★ 3,546min-dallemin(DALL·E) 是一个将 DALL·E Mini 快速移植到 PyTorch 的精简实现,旨在以最少的代码和依赖复现文本生成图像的核心能力。它解决了原始★ 3,488Diffusion-Models-Papers-Survey-Taxonomy扩散模型论文、综述与分类体系的精选资料库,系统梳理扩散模型领域的研究脉络与分类框架,是快速入门与持续跟踪该领域进展的必备导航工具。★ 3,364awesome-generative-ai-apps这是一个精选的开源生成式 AI 应用合集,收录了 50 多个可直接克隆、部署并商业化的项目,涵盖图像生成、视频工具、虚拟试穿、AI SaaS 模板及平台集成等类★ 3,347Kandinsky-2Kandinsky-2 是一个多语言文本生成图像(text2image)的潜在扩散模型,由俄罗斯团队开发。它解决了现有文本到图像模型对英文支持良好但多语言能力不★ 2,811Stable-Diffusion这是一个聚焦Stable Diffusion生态的中文教程与资源聚合项目,旨在帮助用户从零开始掌握AI图像生成技术。项目覆盖了FLUX、SDXL、SD3等主流模★ 2,769dalle-playgrounddalle-playground 是一个基于 Web 的文本生成图像交互界面,最初支持 DALL-E Mini,现已转向 Stable Diffusion。它解★ 2,738InfiniteYouInfiniteYou 是一个基于扩散模型的图像生成与编辑工具,核心解决身份保持下的灵活照片重绘问题。它允许用户在不丢失人物身份特征的前提下,对照片进行多种编辑★ 2,683VQGAN-CLIPVQGAN-CLIP 是一个将 VQGAN 与 CLIP 模型结合用于本地文本生成图像的开源项目。它解决了用户需要依赖 Google Colab 等云端环境才能★ 2,643big-sleepbig-sleep 是一个基于命令行的文本生成图像工具,由 OpenAI 的 CLIP 模型和 BigGAN 生成对抗网络结合实现。它解决的核心问题是:在没有配★ 2,574Awesome-Text-to-ImageAwesome-Text-to-Image 是一个聚焦文本到图像生成/合成领域的精选资源列表,旨在系统梳理该方向的研究进展、关键技术和开源工具。它解决了研究人员★ 2,447paperbananapaperbanana 是 Google Research 论文中 PaperBanana 的开源实现与扩展,旨在自动化生成学术图表、示意图和研究可视化,并拓展★ 2,386carefree-creatorcarefree-creator 是一个基于 Stable Diffusion 的 AI 图像生成与编辑工具,主打无限画布上的自由创作。它解决了传统图像生成工具★ 1,936RPG-DiffusionMasterRPG-DiffusionMaster 是一个基于多模态大语言模型(MLLM)的文本到图像生成与编辑框架,发表于 ICML 2024。它解决传统扩散模型在复杂提★ 1,842CogViewCogView 是智源研究院开源的文本生成图像模型,源自 NeurIPS 2021 论文。它基于 Transformer 架构,将文本描述转化为高质量图像,解决★ 1,799BrushNetBrushNet 是一个即插即用的图像修复(inpainting)模型,基于分解双分支扩散架构,论文发表于 ECCV 2024。它解决现有扩散模型在图像修复时难★ 1,744TokenFlowTokenFlow 是 ICLR 2024 的官方 PyTorch 实现,用于实现基于扩散模型的视频编辑。它解决了文本到视频编辑中常见的时序不一致问题,即逐帧独★ 1,707ru-dalleru-dalle 是一个基于俄语的文本生成图像项目,旨在让俄语用户能够使用自然语言描述生成高质量的图像。它解决了 OpenAI DALL-E 模型主要支持英语、★ 1,640InfinityInfinity 是一个基于自回归建模的高分辨率图像生成框架,核心创新在于将图像 token 化为 bitwise 形式,并通过大规模 bitwise 自回归建★ 1,589MiniMax-MCPMiniMax-MCP 是 MiniMax 官方推出的 Model Context Protocol (MCP) 服务器,旨在将 MiniMax 的多模态生成能★ 1,584WebAI2APIWebAI2API 是一个基于 Camoufox 浏览器自动化框架的开源工具,旨在将网页版 AI 服务(如 LMArena、Gemini 等)封装成标准的 Op★ 1,370UNOUNO 是一个基于扩散 Transformer 的图像生成定制化方法,由清华大学提出,论文发表于 ICCV 2025。它解决的是当前定制化生成模型只能处理单主体★ 1,363cog-face-to-manycog-face-to-many 是一个基于 Replicate Cog 和 ComfyUI 的图像生成工具,能将任意人脸照片转换成多种风格化的角色形象,包括视★ 1,359airunnerAirunner 是一个面向桌面端的离线 AI 推理引擎,集成了图像生成、实时语音对话、LLM 聊天机器人和自动化工作流。它解决的是用户对 AI 工具隐私和本地★ 1,316Awesome-Controllable-T2I-Diffusion-Models这是一个关于文本到图像扩散模型可控生成的资源集合,旨在解决扩散模型生成结果难以精确控制的问题。项目系统整理了该领域的前沿研究、方法和工具,涵盖空间控制(如布局、★ 1,111CogView4CogView4 是智谱AI开源的多模态图像生成模型系列,包含 CogView4、CogView3-Plus 和 CogView3(ECCV 2024)三个版本★ 1,099text2roomText2Room 是一个利用 2D 文本生成图像模型来创建带纹理 3D 网格的开源项目,出自 ICCV2023。它解决了从单一文本提示直接生成连贯、可探索的 ★ 1,091MultiDiffusionMultiDiffusion 是 ICML 2023 论文的官方 PyTorch 实现,提出了一种无需额外训练即可实现可控图像生成的新方法。它通过将多个扩散生成★ 1,069jimeng-apijimeng-api 是一个非官方的即梦(Dreamina)API 逆向工程项目,通过解析官方接口,为开发者提供文本生成图像和图像生成图像的能力。它解决了官方 ★ 1,040RadiataRadiata 是一个基于 diffusers 库构建的 Stable Diffusion WebUI,旨在为图像生成提供一个更现代、更易扩展的图形化界面。它解★ 962CogView2CogView2是清华大学与智谱AI联合推出的文本生成图像模型,基于层次化Transformer架构,在CogView基础上显著提升生成速度与图像质量。它解决的★ 950unfake.jsunfake.js 是一个运行在浏览器中的图像修复工具,专门针对 AI 生成的像素画和矢量图进行后处理。AI 生成的图像往往带有模糊、噪点、边缘不齐等伪影,该项★ 923muse-maskgit-pytorchMuse-MaskGit-PyTorch 是 Google 提出的 Muse 文本生成图像模型的非官方 PyTorch 实现。Muse 采用掩码生成式 Tran★ 918refinersrefiners 是一个基于 PyTorch 的微框架,旨在为基础模型适配提供一流的 API。它解决了扩散模型(如 Stable Diffusion)在微调、适★ 834Lora-for-Diffusers这是一个面向AI图像生成研究者的LoRA微调教程项目,旨在用最易懂的方式讲解如何在diffusers框架中使用LoRA(低秩适配)技术。项目解决了Stable ★ 822TF-ICONTF-ICON 是一个基于扩散模型的免训练跨域图像合成工具,由 ICCV 2023 论文官方实现。它解决的是将不同来源、不同风格的图像(如真实照片与艺术画作)自★ 815Autoregressive-Models-in-Vision-Survey这是一份关于视觉自回归模型(AR models)的综述论文项目,发表于TMLR 2025。它系统梳理了自回归模型在计算机视觉领域的研究进展,涵盖图像生成、视频预★ 808