image-generation

本站收录 607 个带「image-generation」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

stable-diffusion-webui最流行的 Stable Diffusion Web UI,通过浏览器界面运行 SD 模型,支持文生图、图生图、超分辨率、蒙版重绘等丰富功能与庞大的扩展生态,是 ★ 165,151unsloth本地运行与训练文本、扩散模型的 UI 工具,支持 Kimi、Gemma、Qwen3.6、DeepSeek-V4、FLUX 等最新模型,让个人开发者也能轻松微调与★ 77,026OpenMontage全球首个开源的智能体视频制作系统,提供 12 条生产流水线、100 余种工具以及 700 多个智能体技能与制作知识文件。可将 AI 编程助手转化为完整的视频生产★ 61,862LocalAI开源的本地 AI 推理引擎,无需 GPU 即可在任何硬件上运行 LLM、视觉、语音、图像与视频等多种模型,兼容 OpenAI API 接口,是构建私有化 AI ★ 49,323khoj可自托管的 AI 第二大脑,支持联网搜索与本地文档问答,能构建自定义智能体、定时自动化任务并进行深度研究。可将 GPT、Claude、Gemini、Llama、★ 37,537diffusersHugging Face 官方出品的扩散模型工具库,基于 PyTorch,提供图像、视频、音频生成领域最先进的扩散模型,接口统一、开箱即用,是研究与生产环境中最★ 34,633Pixelle-Video主打全自动化的 AI 短视频引擎,输入创意即可自动完成脚本、画面与剪辑,大幅降低短视频制作门槛,帮助个人创作者与团队批量、高效地产出高质量短视频内容。★ 28,519InvokeAI面向 Stable Diffusion 模型的领先创意引擎,服务专业设计师、艺术家与爱好者,提供业界一流的 WebUI 与最新的 AI 视觉生成技术,让从灵感到★ 28,313guizang-ppt-skillAI 智能体技能:一键生成精美 HTML 幻灯片,支持杂志风编辑版式与瑞士风格设计、图像提示词、社交媒体封面,并内置 WebGL/低功耗演示运行环境。★ 27,096pytorch-CycleGAN-and-pix2pixPyTorch 实现的经典图像到图像转换框架,包含 pix2pix 与 CycleGAN 两大模型,支持风格迁移、图像修复、超分辨率等任务,是学习与复现 GAN★ 25,254Toonflow-app开源的一站式 AI 短剧创作工具,可将小说、剧本快速转化为动画短剧,集成 AI 编剧、智能分镜、角色与视频生成等能力,跨平台桌面端轻量部署,助力创作者低成本批量★ 16,224stable-diffusion-webui-colabstable-diffusion-webui-colab 是一个基于 Google Colab 的 Stable Diffusion WebUI 一键部署方案。★ 15,915satoriVercel 开源的高性能 HTML/CSS 转 SVG 渲染库,无需浏览器即可在服务端将网页元素渲染为矢量图,常用于生成社交媒体卡片、OG 封面与自定义图片,★ 13,991awesome-nano-banana-pro-prompts这是一个专门为 Google Gemini 图像生成模型(Nano Banana Pro)打造的开源提示词库,号称全球最大,收录了超过 10,000 条精选提示★ 13,515CycleGAN经典无监督图像风格迁移框架,无需成对数据即可实现照片转绘画、马变斑马等趣味效果,广泛应用于风格迁移与图像翻译领域,是计算机视觉领域教科书级的开源项目。★ 12,876KrillinAIKrillinAI 是一个基于大语言模型的 AI 视频翻译与配音工具,面向个人用户和 AI Agent 提供完整的视频本地化流水线,涵盖下载、转录、翻译、TTS★ 12,511ian-xiaohei-illustrations专为中文内容打造的小黑怪诞风格正文配图生成技能,输出 16:9 白底手绘风格图片,辅以少量红橙蓝批注,适合 Codex 等 AI 编程助手一键调用,为文章快速配★ 12,223pix2pix基于条件对抗网络的开创性图像到图像翻译模型,只需成对数据即可实现线稿上色、语义图转照片、街景转换等任务,是 pix2pix 家族的奠基之作,对后续研究影响深远。★ 10,662awesome-gpt-image-2这是全球最大的 GPT Image 2 提示词库,每日更新,收录超过 2000 条精选提示词,每条都附带预览图,支持 16 种语言。项目旨在解决用户在使用 Op★ 9,975neural-doodle基于深度神经网络与语义风格迁移的涂鸦作画工具,可将简单涂鸦变成精致画作,支持照片无缝纹理生成、图像风格迁移与样例放大,趣味性与实用性兼备。★ 9,851VARNeurIPS 2024 最佳论文奖的官方实现,提出视觉自回归建模(VAR),通过下一尺度预测生成图像,以超简单易用的方式达到超越扩散模型的最新效果,并揭示了视★ 8,733dream-textures将 Stable Diffusion 直接集成进 Blender 的插件,无需离开建模软件即可生成纹理、材质与贴图,支持文生图、图生图与深度图引导,是 3D 艺★ 8,210awesome-gpt4o-images这是一个精选的GPT-4o及gpt-image-1生成图像与提示词的集合仓库,旨在展示OpenAI最新图像生成能力。项目收集了包括吉卜力风格、动漫、卡通等多种风★ 8,157PaddleGAN飞桨 PaddlePaddle 官方 GAN 库,汇集人脸动画驱动、Wav2Lip 口型合成、图片修复、照片转卡通、风格迁移、GPEN 人脸增强等众多实用应用,★ 8,045mmagicOpenMMLab 推出的多模态生成智能创作工具箱,提供开箱即用的 AIGC 能力、易用 API 与丰富模型库,涵盖文生图、图像/视频修复与增强等任务,是搭建生★ 7,470stable-diffusion.cpp纯 C/C++ 实现的扩散模型推理库,无需 Python 环境即可运行 SD、Flux、Wan、Qwen Image、Z-Image 等主流模型,性能卓越、部署★ 7,469guizang-social-card-skill面向 Claude Code / Codex 的社媒卡片生成技能,可一键产出小红书图文及微信公众号 21:9+1:1 封面组合,内置编辑设计 × 瑞士视觉体系、★ 7,304vllm-omni面向全模态模型的统一高效推理框架,支持文本、图像、视频、音频等多种模态的高性能推理,延续 vLLM 的工程优势,为多模态大模型应用提供稳定快速的部署方案。★ 7,135ip-as-logo-skill这是一个为 AI 编程助手(如 Codex)设计的技能包,用于生成高度简化、圆润、带有微妙新拟物风格的 IP 吉祥物 Logo。它解决了非专业设计师在需要快速产★ 5,682GPT-Image2-SkillGPT-Image2-Skill 是一个围绕 OpenAI GPT Image 2 模型打造的开源工具集,集提示词画廊、提示词库、Agent 技能和命令行工具于★ 5,599multidiffusion-upscaler-for-automatic1111Stable Diffusion WebUI 的高效放大扩展,通过 Tiled Diffusion 分块处理与 VAE 优化,在显存受限的情况下也能生成高分辨率★ 4,995StableSwarmUIStability AI 推出的模块化 Stable Diffusion Web 界面,将 ComfyUI 等强力工具无缝整合,强调高性能、易扩展与强大工具的无★ 4,947DragGANDragGAN 全功能开源实现,支持通过拖拽点交互式操控生成图像,在线 Demo 与本地部署均可使用,代码、模型全部开源,兼容 Windows、macOS、Li★ 4,944SwarmUISwarmUI 是一个模块化的 Stable Diffusion 网页用户界面,前身为 StableSwarmUI。它致力于将 Stable Diffusion★ 4,618snappySnappy 是一个 PHP 库,用于将 URL 或 HTML 页面转换为缩略图、快照或 PDF 文件。它本质上是 wkhtmltopdf 和 wkhtmlto★ 4,475OmniGenOmniGen 是一个统一图像生成框架,基于扩散模型,通过单一模型实现文生图、图像编辑、多图融合、角色一致性生成等多种任务,无需额外模块或复杂pipeline。★ 4,345AnyDoorAnyDoor 是一个零样本(zero-shot)物体级图像定制工具,基于论文《Anydoor: zero-shot object-level image cu★ 4,241Image-Super-Resolution-via-Iterative-Refinement这是一个基于扩散概率模型(DDPM)的图像超分辨率非官方实现,源自论文《Image Super-Resolution via Iterative Refinem★ 3,924gpt_image_playgroundgpt_image_playground 是一个基于 OpenAI gpt-image-2 API 的图片生成与编辑工具,采用 TypeScript 和 Rea★ 3,807Gemini-APIGemini-API 是一个通过逆向工程实现的 Python 库,用于非官方访问 Google Gemini 网页应用的功能。它解决了官方 API 未开放或使用★ 3,544awesome-generative-ai-apps这是一个精选的开源生成式 AI 应用合集,收录了 50 多个可直接克隆、部署并商业化的项目,涵盖图像生成、视频工具、虚拟试穿、AI SaaS 模板及平台集成等类★ 3,347mono-color-skillmono-color-skill 是一个面向 AI 智能体的技能包,专门用于生成单色编辑风格的印刷图像。它解决的是 AI 图像生成中风格不统一、缺乏设计感的问题★ 3,306HunyuanImage-3.0HunyuanImage-3.0 是腾讯开源的图像生成模型,定位为原生多模态模型,不仅支持文生图,还具备多模态理解与编辑能力。它解决传统扩散模型在语义理解、多轮★ 3,279Dreambooth-Stable-DiffusionDreambooth-Stable-Diffusion 是一个基于 Stable Diffusion 的模型微调工具,通过结合 Dreambooth 和 Tex★ 3,212takumitakumi 是一个用 Rust 编写的开源工具,用于从 JSX、HTML 和 CSS 渲染 Open Graph 图片和分页 PDF。它解决了传统方案依赖无头★ 3,053pwa-asset-generatorpwa-asset-generator 是一个自动化生成 PWA(渐进式 Web 应用)所需图标的命令行工具。它解决开发者手动制作多尺寸图标、启动屏和 favi★ 3,037Kandinsky-2Kandinsky-2 是一个多语言文本生成图像(text2image)的潜在扩散模型,由俄罗斯团队开发。它解决了现有文本到图像模型对英文支持良好但多语言能力不★ 2,811InfiniteYouInfiniteYou 是一个基于扩散模型的图像生成与编辑工具,核心解决身份保持下的灵活照片重绘问题。它允许用户在不丢失人物身份特征的前提下,对照片进行多种编辑★ 2,683contrastive-unpaired-translationCUT(Contrastive Unpaired Translation)是一个基于对比学习的无配对图像到图像翻译框架,由Taesung Park等人于ECCV★ 2,556Awesome-Text-to-ImageAwesome-Text-to-Image 是一个聚焦文本到图像生成/合成领域的精选资源列表,旨在系统梳理该方向的研究进展、关键技术和开源工具。它解决了研究人员★ 2,447