RPG-DiffusionMaster

用多模态大模型把复杂提示词变成高质量图像,还能对话式编辑

RPG-DiffusionMaster 是一个基于多模态大语言模型(MLLM)的文本到图像生成与编辑框架,发表于 ICML 2024。它解决传统扩散模型在复杂提示词下生成质量差、多对象关系混乱的问题。核心能力包括:利用 MLLM 将复杂提示词重写为多个子提示词,规划生成布局,并通过区域级扩散生成高保真图像。支持多轮对话式图像编辑,无需额外训练即可适配现有扩散模型。项目提供完整代码、推理脚本和示例,便于研究者复现和二次开发。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1845
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队YangLing0818
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Jupyter Notebook
技术栈/模型image-editting,large-language-models,multimodal-large-language-models,text-to-image
GitHub 星标★ 1845
30天Star增速
HF 下载量
上线时间2024-01-22 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 30 分钟 部署方式:库/依赖 6 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python + Jupyter Notebook 运行环境(项目开发语言为 Jupyter Notebook)
  • 需安装 diffusers 库(Quick Start 要修改其中部分函数)
  • 基础扩散模型权重:SD v1.4 / v1.5 / v2.0 / v2.1
  • 约 8GB 显存的显卡即可跑通 Quick Start notebook

安装与启动步骤

  1. 1克隆官方仓库

    从 GitHub 拉取 RPG-DiffusionMaster 源码,后续 notebook 与示例都基于该仓库。

    git clone https://github.com/YangLing0818/RPG-DiffusionMaster.git
  2. 2准备运行环境

    README 未给出 pip/conda 安装命令,需自行准备可运行 Jupyter Notebook 的 Python 环境并安装 diffusers。

  3. 3准备基础模型

    按 README 说明选用 SD v1.4、v1.5、v2.0、v2.1 等 base diffusion model,提前下载或配置好权重。

  4. 4打开 Quick Start

    打开仓库内的 Example_Notebook(RegionalDiffusion_playground.ipynb),该示例把图像等分为两个子区域。

  5. 5小幅修改 diffusers

    按 README 提示对 diffusers 库中部分函数做少量改动,以实现区域级扩散生成。

  6. 6运行并生成图像

    在 notebook 中按单元格顺序执行,可在 8GB 显存显卡上得到区域划分的生成结果。

如何确认成功

notebook 单元格全部执行无误并输出图像,即表示区域级生成流程跑通。

常见问题

Q:需要多少显存?

A:README 明确说明,使用 8GB 显存的显卡即可运行 Quick Start 中的 notebook 示例。

Q:支持哪些基础扩散模型?

A:README 列出 SD v1.4、v1.5、v2.0、v2.1 等 base diffusion models,可在这些模型上得到不错效果。

Q:必须用 GPT-4 这类闭源大模型吗?

A:不是。README 说明既可用 GPT-4、Gemini-Pro 等专有 MLLM,也可用 miniGPT-4 等开源本地 MLLM。

Q:需要额外训练吗?

A:不需要。RPG 是 training-free 范式,无需训练即可适配现有扩散模型。

Q:有完整安装步骤吗?

A:README 节选中未给出安装命令,仅指向 Example_Notebook,详细说明需参考论文与 notebook 内容。

注意事项

  • README 未提供 pip/conda 安装命令,环境依赖需自行按 diffusers 生态准备。
  • Quick Start 仅演示将图像等分为两个子区域,更多区域与复杂布局需自行扩展配置。
  • 运行前需对 diffusers 库中相关函数做小幅修改,建议先备份原文件。

核心亮点

  • 提出 Recaptioning+Planning+Generation 三阶段框架,显著提升复杂提示词下的图像生成质量
  • 支持多轮对话式图像编辑,交互自然,无需微调模型
  • 基于 MLLM 的区域级生成,能准确处理多对象空间关系

不足之处

  • 依赖外部 MLLM 和扩散模型,推理资源消耗较高
  • 文档/社区待观察

适用场景

  • 复杂场景文本生成图像(如多物体、空间关系描述)
  • 交互式图像编辑(对话修改局部内容)
  • 多模态大模型与扩散模型结合的研究实验

替代项目

ControlNet、InstructPix2Pix、DALL-E 3

项目介绍

RPG-DiffusionMaster 是图像领域的开源项目,由 YangLing0818 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,845)位列前 30%,在图像分类的 839 个项目里位列前 10%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:复杂场景文本生成图像(如多物体、空间关系描述)。同类可对比的替代方案包括 ControlNet、InstructPix2Pix、DALL-E 3。

上一篇:carefree-creator

下一篇:CogView

同类项目推荐

satori 开源

网页代码一键变高清图,放大不糊,不用截图

Enlightened library to convert HTML and CSS to SVG

★ 13967 2026-08-09
C2GAN 开源

用关键点精准控制图像生成,让AI画出你想要的结构

[ACM MM 2019 Oral] Cycle In Cycle Generative Adversarial Networks for Keypoint-Guide···

★ 70 2026-08-09
ComfyUI 开源

像搭积木一样连节点,生图流程自己搭

The most powerful and modular diffusion model GUI, api and backend with a graph/node···

★ 134493 2026-08-09