text-to-image-generation

本站收录 30 个带「text-to-image-generation」标签的 AI 开源项目

SanaNVIDIA 开源的高效高分辨率图像合成模型,采用线性 Diffusion Transformer 架构,在保持高质量生成的同时显著降低计算开销,支持超高清图像★ 9,163ComfyUI-LTXVideoComfyUI-LTXVideo 是 ComfyUI 的官方插件,用于集成 LTX-Video 视频生成模型。LTX-Video 是 Lightricks 推出★ 4,146InfinityInfinity 是一个基于自回归建模的高分辨率图像生成框架,核心创新在于将图像 token 化为 bitwise 形式,并通过大规模 bitwise 自回归建★ 1,589NanoBananaEditorNanoBananaEditor 是一个基于 Gemini 2.5 Flash 图像 API 构建的 AI 图像生成与编辑应用,旨在成为 AI 图像创作的中枢。★ 715LiquidLiquid 是一个基于大型语言模型的可扩展统一多模态生成框架,已被 IJCV 接收。它旨在解决传统扩散模型在图像生成中步骤多、速度慢,且难以与语言模型统一的问★ 640DiffusionOPSDDiffusionOPSD 是一个针对扩散模型的在线策略自蒸馏(On-Policy Self-Distillation)训练框架,旨在解决扩散模型在生成质量和训★ 555TokenFlowTokenFlow 是一个面向多模态理解与生成的统一图像分词器,由字节跳动提出,论文发表于 CVPR 2025。它解决的核心问题是传统图像分词器在理解任务(如分★ 469AutoStudioAutoStudio 是一个面向多轮交互式图像生成的开源框架,旨在解决用户在连续对话中生成风格一致、主体统一图像的问题。传统文生图模型难以在多次交互中保持同一主★ 452Awesome_Matching_Pretraining_Transfering这是一个精选论文列表项目,收录了大型多模态模型(LMM)在感知、生成、统一方面的前沿研究,同时覆盖参数高效微调(PEFT)、视觉-语言预训练(VLP)以及传统图★ 446MagicBrushMagicBrush 是 NeurIPS 2023 收录的一个用于指令引导图像编辑的手工标注数据集。它解决了现有图像编辑数据集依赖自动生成、指令与编辑结果不匹配★ 413stable-diffusion-colabstable-diffusion-colab 是一个基于 Google Colab 的 Jupyter Notebook 项目,专门用于运行 Stable Di★ 322SPOSPO(Step-by-step Preference Optimization)是一个CVPR 2025的扩散模型后训练方法,旨在从通用人类偏好中提升文生图模★ 269CFGppCFGpp 是 ICLR2025 论文《CFG++: manifold-constrained classifier free guidance for dif★ 245AttackVLMAttackVLM 是一个针对视觉语言模型(VLM)的红队攻击工具集,源自 NeurIPS 2023 论文。它提供了一系列对抗性攻击方法,用于评估和揭示 VLM★ 231SLDSLD是一个由CVPR 2024收录的官方实现项目,提出了一种自校正的大语言模型控制扩散模型方法。它解决的是文本到图像生成中,扩散模型难以精确遵循复杂文本指令、★ 187ReNOReNO 是一个针对一步式文本到图像生成模型的推理时优化框架,源自 NeurIPS 2024 论文。它通过基于奖励的噪声优化,在无需额外训练的情况下,显著提升一★ 167MaskUnetMaskUnet 是 CVPR 2025 的官方 PyTorch 实现,针对扩散模型提出一种参数掩码策略。核心思想是并非所有参数对生成同等重要,通过训练中动态掩★ 158attention-interpolation-diffusion这是一个 NeurIPS 2024 的官方实现,针对文本到图像扩散模型中的注意力插值技术。它解决的是在 Stable Diffusion 等模型中,如何通过插值★ 111Gen4GenGen4Gen 是一个用于生成式多概念组合的图像数据管线,旨在解决文本到图像模型中多概念组合生成质量不佳的问题。它通过利用 LLM 和 Stable Diffu★ 110DSGDSG(Davidsonian Scene Graph)是一个用于文本到图像生成评估的开源项目,发表于ICLR 2024。它针对当前文本到图像模型评估中仅关注整★ 109TextAtlasTextAtlas 是一个用于训练和评估模型密集文本图像生成能力的大规模数据集,由 ICML 2026 论文提出。它解决了当前文本到图像模型在生成包含密集、复杂★ 94graftinggrafting 是 NeurIPS 2025 Oral 论文的官方代码,研究扩散 Transformer(DiT)的设计空间。它提出一种称为“嫁接”的架构编辑★ 75ContextDiffContextDiff 是一个基于扩散模型的文本引导图像与视频生成框架,由南洋理工大学等机构提出,相关论文被 ICLR 2024 接收。它旨在解决现有扩散模型在★ 74GenExamGenExam 是一个面向多学科文生图模型的评测基准,旨在系统评估文本到图像生成模型在跨学科知识理解与视觉呈现上的能力。它通过设计涵盖科学、历史、艺术等领域的考★ 72ITI-GENITI-GEN是一个基于扩散模型的包容性文本到图像生成工具,旨在解决传统文生图模型在生成特定群体(如不同种族、性别、年龄等)时存在偏见和表征不足的问题。它通过提★ 67awesome-diffusion-iclr-2025这是一个整理 ICLR 2025 会议上扩散模型相关投稿的精选列表,主要面向研究人员和工程师。它从 OpenReview 平台抓取并分类了与扩散模型(如 Sta★ 61VPGenVPGen是一个基于视觉编程的文本到图像生成与评估框架,来自NeurIPS 2023论文。它通过将文本提示分解为逐步的视觉程序(如对象检测、布局生成、图像编辑等★ 57api-examplesHotpot.ai 官方 API 示例仓库,展示如何调用其图像生成与处理服务。该 API 提供 Stable Diffusion 文生图、背景移除、图像放大、老★ 55gpicGPIC 是一个用于视觉生成的大规模许可图像语料库的官方代码库,旨在为文本到图像生成等视觉生成任务提供高质量的训练数据。该项目解决了当前视觉生成模型训练中数据获★ 55AiShortsVideosGenerator这是一个基于 ASP.NET Core 和 Next.js 的全栈开源项目,用于自动生成带字幕的 AI 短视频。它整合了 Gemini AI、AWS Lambd★ 55