image-editing
本站收录 85 个带「image-editing」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
PaddleGAN飞桨 PaddlePaddle 官方 GAN 库,汇集人脸动画驱动、Wav2Lip 口型合成、图片修复、照片转卡通、风格迁移、GPEN 人脸增强等众多实用应用,★ 8,045
mmagicOpenMMLab 推出的多模态生成智能创作工具箱,提供开箱即用的 AIGC 能力、易用 API 与丰富模型库,涵盖文生图、图像/视频修复与增强等任务,是搭建生★ 7,470
eSearcheSearch 是一款基于 Electron 和 TypeScript 开发的跨平台截屏与 OCR 工具,支持 Windows、Linux 和 macOS。它解★ 7,222
GPT-Image2-SkillGPT-Image2-Skill 是一个围绕 OpenAI GPT Image 2 模型打造的开源工具集,集提示词画廊、提示词库、Agent 技能和命令行工具于★ 5,599
DragGANDragGAN 全功能开源实现,支持通过拖拽点交互式操控生成图像,在线 Demo 与本地部署均可使用,代码、模型全部开源,兼容 Windows、macOS、Li★ 4,944
AnyDoorAnyDoor 是一个零样本(zero-shot)物体级图像定制工具,基于论文《Anydoor: zero-shot object-level image cu★ 4,241
gpt_image_playgroundgpt_image_playground 是一个基于 OpenAI gpt-image-2 API 的图片生成与编辑工具,采用 TypeScript 和 Rea★ 3,807
PromptEnhancerPromptEnhancer 是一个提示词重写工具,旨在将用户输入的图像生成提示词优化为更清晰、结构化的版本,从而提升生成图像的质量。它基于视觉语言模型(VLM★ 3,779
InfiniteYouInfiniteYou 是一个基于扩散模型的图像生成与编辑工具,核心解决身份保持下的灵活照片重绘问题。它允许用户在不丢失人物身份特征的前提下,对照片进行多种编辑★ 2,683
DreamOmni2DreamOmni2 是一个基于多模态指令的图像编辑与生成统一模型,来自 CVPR2026 Highlight 论文的官方实现。它解决的是传统图像编辑工具难以理★ 1,983
LanPaintLanPaint 是一个面向 Stable Diffusion 系列模型的免训练图像修复(inpainting)方案,同时提供 ComfyUI 自定义节点。它要★ 1,416
LanceLance 是一个仅 3B 激活参数的原生统一多模态模型,专攻图像与视频的理解、生成和编辑。它解决了传统多模态模型需要庞大参数、且各任务分离的问题,通过单一模型★ 1,349
BerniniBernini 是一个统一的视频生成与编辑框架,将基于多模态大语言模型(MLLM)的语义规划器与基于扩散Transformer(DiT)的渲染器相结合。它解决的★ 1,323
Paint-by-ExamplePaint-by-Example 是一个基于扩散模型的图像编辑工具,通过给定示例图像,实现对输入图像的语义编辑,如替换物体、改变风格等。它解决了传统图像编辑需要★ 1,252
SDEditSDEdit 是一个基于 PyTorch 的图像生成与编辑工具,核心思想是利用随机微分方程(SDE)在图像生成和编辑过程中引入可控的随机性。它解决了传统图像编辑★ 1,171
FateZeroFateZero 是一个基于 Stable Diffusion 的零样本文本驱动视频编辑工具,来自 ICCV 2023 Oral 论文。它解决了传统视频编辑需要★ 1,162
PowerPaintPowerPaint 是一个基于 Stable Diffusion 的高质量多功能图像修补模型,由上海AI实验室等机构在 ECCV 2024 提出。它解决了传统★ 1,114
image-multiple-angles-3d-camera这是一个基于 Three.js 和 Gradio 构建的 3D 交互式图像生成工具,允许用户通过拖拽 3D 空间中的相机或调整滑块(方位角、仰角、距离)来自由控★ 1,016
UniPicUniPic 是一个开源的 SOTA 多图像编辑模型,专注于通过自然语言指令对多张输入图像进行联合编辑。它解决了传统图像编辑模型只能处理单张图像、难以理解多图之★ 875
anycost-ganAnycost GANs 是 CVPR 2021 收录的交互式图像合成与编辑框架,由 MIT 等机构提出。它解决的是 GAN 模型在推理时计算开销大、难以在普通★ 779
MagicDanceMagicDance(又称MagicPose)是一个基于扩散模型的人体姿态与面部表情重定向工具,由ICML 2024论文提出。它解决的是在保持人物身份特征(如面★ 778
ilab-conjureilab-conjure 是一个面向 GPT-image-2 的 AI 图片生成 WebUI 工作台,旨在解决开发者或设计师在调用图像生成 API 时缺乏统一操★ 714
ChronoEditChronoEdit 是一个面向图像编辑与世界模拟的时间推理框架,由 ICLR 2026 论文提出。它解决的是现有图像编辑模型缺乏对时间动态理解的问题,即无法根★ 707
Awesome-CVPR2026-CVPR2025-ICCV2025-CVPR2024-ECCV2026-ECCV2024-AIGC这是一个汇集CVPR、ICCV、ECCV等顶级计算机视觉会议中AIGC相关论文与代码的精选列表。项目旨在解决研究者难以系统追踪前沿AIGC成果的问题,按会议年份★ 676
HiDTHiDT 是 CVPR 2020 Oral 论文《High-Resolution Daytime Translation Without Domain Labe★ 652
DiffusionOPSDDiffusionOPSD 是一个针对扩散模型的在线策略自蒸馏(On-Policy Self-Distillation)训练框架,旨在解决扩散模型在生成质量和训★ 555
photoshop-mcpphotoshop-mcp 是一个基于 MCP(模型上下文协议)的服务器,让 AI 助手(如 Claude)能够通过 50 多个工具直接控制 Adobe Pho★ 526
DiffMorpherDiffMorpher 是 CVPR 2024 的官方实现,旨在利用扩散模型的能力实现高质量的图像变形(morphing)。传统图像变形方法在保持语义一致性和视★ 509
Ovis-U1Ovis-U1 是一个统一的多模态大语言模型框架,将视觉理解、文生图和图像编辑能力整合到单一模型中。它解决了传统上需要分别部署多个专用模型(如理解模型、生成模型★ 453
multimodal-garment-designerMultimodal Garment Designer 是一个基于潜在扩散模型的时尚图像编辑工具,源自 ICCV 2023 论文。它解决的是服装设计场景中,通过★ 445
Collaborative-DiffusionCollaborative Diffusion 是一个面向多模态条件引导的扩散模型框架,核心解决现有扩散模型难以同时利用多种异构条件(如文本、草图、语义图、参考★ 443
ConSinGANConSinGAN 是单图像生成对抗网络(GAN)的 PyTorch 实现,源自论文《Improved Techniques for Training Sing★ 442
nova-image-studioNova Image Studio 是一个自托管的 AI 图像生成工作台,旨在为用户提供灵活、多模式的图像创作环境。它解决了自托管方案中常见的功能单一、交互笨重★ 437
Video-P2PVideo-P2P 是一个基于 Stable Diffusion 的视频编辑工具,通过控制交叉注意力机制实现文本驱动的视频编辑。它解决了传统视频编辑需要逐帧处理★ 430
FreeDragFreeDrag 是一个基于点的图像编辑工具,由 CVPR 2024 论文官方实现。它解决了 DragGAN 等现有方法在点拖拽编辑中因特征更新不稳定而导致的编★ 420
reconstruction-alignmentReconstruction Alignment 是 ICLR 2026 论文的官方实现,旨在通过自监督学习提升统一多模态模型(如文本到图像、图像编辑、图像理解★ 417
MagicBrushMagicBrush 是 NeurIPS 2023 收录的一个用于指令引导图像编辑的手工标注数据集。它解决了现有图像编辑数据集依赖自动生成、指令与编辑结果不匹配★ 413
PnPInversionPnPInversion 是 ICLR 2024 的官方实现,提出一种仅需三行代码即可增强扩散模型编辑能力的方法。它解决现有基于扩散模型的图像编辑中,编辑结果与★ 413
stable-flowStable Flow 是 CVPR 2025 论文的官方实现,提出一种无需训练的图像编辑方法。它针对扩散模型(如 Stable Diffusion)在编辑时因★ 411
LLMGALLMGA是一个基于多模态大语言模型的图像生成助手,源自ECCV 2024 Oral论文。它旨在解决用户难以精确控制图像生成和编辑的问题,通过将大语言模型的推理★ 395
mega-data-factorymega-data-factory 是一个面向大规模基础模型训练的多模态数据流水线框架,专注于解决数据质量与数据规模之间的平衡问题。它提供了一套从数据采集、清洗★ 379
DanceOPDDanceOPD 是一个基于策略内生成场蒸馏(On-Policy Generative Field Distillation)的图像生成与编辑工具。它解决的是传★ 371
VoostVoost 是一个基于扩散 Transformer 的统一框架,用于双向虚拟试穿(try-on)和虚拟脱衣(try-off)。它解决了传统虚拟试穿模型只能单向处★ 344
ComfyUI_InfiniteYouInfiniteYou 是一个基于 FLUX 的身份保持图像生成与编辑项目,荣获 ICCV 2025 Highlight。它通过 ComfyUI 原生节点集成,★ 299
FireFlow-Fast-Inversion-of-Rectified-Flow-for-Image-Semantic-EditingFireFlow 是一个针对 FLUX-dev 模型的图像语义编辑加速方案,核心创新在于将传统需要数十步的扩散模型反演和编辑过程压缩至各 8 步,实现约 3 倍★ 295
ForgeditForgedit 是一个基于 Stable Diffusion 和 DreamBooth 的文本引导图像编辑工具,旨在解决传统图像编辑中需要精确蒙版或复杂操作的★ 284
ReNoise-InversionReNoise-Inversion 是论文《ReNoise: Real Image Inversion Through Iterative Noising》的官★ 264
ai-picture-editorai-picture-editor 是一个面向 AI 编程学习的全栈实战项目,用自然语言驱动图像编辑。它把大模型 Agent 能力与 Canvas 画布结合,用★ 263
instruction-tuned-sdinstruction-tuned-sd 是一个用于对 Stable Diffusion 进行指令微调(instruction tuning)的开源项目。它解决★ 250
CFGppCFGpp 是 ICLR2025 论文《CFG++: manifold-constrained classifier free guidance for dif★ 245