dalle-flow

让AI画图听你的,一步步调出高清大片

dalle-flow 是一个基于人类反馈循环的工作流工具,用于从文本生成高清图像。它解决了直接使用 DALL·E 模型时生成结果不可控、质量不稳定、需要反复调整提示词的问题。核心能力包括:将文本提示分解为多个步骤,逐步生成并优化图像;支持用户在每个阶段进行选择和反馈,从而引导生成方向;集成了超分辨率技术,最终输出高清图片。通过人机协作,用户能更精准地控制生成内容,获得符合预期的创意图像。

开源 free 设计创意
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2830
维护状态 低维护
是否开源
定价模式 free

项目数据

分类设计创意
开发团队jina-ai
所属国家
定价模式free
价格说明开源项目,本地部署,完全免费
访问状态
是否开源
开源协议
主要语言Python
技术栈/模型dalle,dalle-mega,dalle-mini,generative-art,glid3,human-in-the-loop,jina,neural-search,openai,swinir
GitHub 星标★ 2830
30天Star增速
HF 下载量
上线时间2022-04-30 00:00:00
最近更新2026-09-19 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:进阶 约 10 分钟 部署方式:Docker 7 步

环境要求

  • Docker 环境,且能使用 --gpus all 调用 NVIDIA GPU
  • 宿主机需开放 51005 端口(对外服务时)
  • 首次运行需稳定网络,下载模型约 10 分钟
  • 本地安装方式需 Python 3.10(依赖 cp310 wheel)与 virtualenv
  • 预留磁盘空间用于模型缓存($HOME/.cache)

安装与启动步骤

  1. 1启动 Docker 容器

    挂载缓存目录避免重复下载模型,暴露 51005 端口并开启 GPU。首次运行约 10 分钟。

    docker run -p 51005:51005 
      -it 
      -v $HOME/.cache:/home/dalle/.cache 
      --gpus all 
      jinaai/dalle-flow
  2. 2按需关闭工作流

    显存不足时可传环境变量关闭部分工作流,防止 out-of-memory 崩溃,例如关闭 GLID3XL。

    docker run -e DISABLE_GLID3XL='1' 
      -p 51005:51005 
      -it 
      -v $HOME/.cache:/home/dalle/.cache 
      --gpus all 
      jinaai/dalle-flow
  3. 3启用 Stable Diffusion

    需自行下载权重,放在名为 ldm/stable-diffusion-v1 的目录并命名为 model.ckpt,再启用开关。

    docker run -e ENABLE_STABLE_DIFFUSION="1" 
      -e DISABLE_DALLE_MEGA="1" 
      -e DISABLE_GLID3XL="1" 
      -p 51005:51005 
      -it 
      -v YOUR_MODEL_PATH/ldm:/dalle/stable-diffusion/models/ldm/ 
      -v $HOME/.cache:/home/dalle/.cache 
      --gpus all 
      jinaai/dalle-flow
  4. 4本地建虚拟环境

    进入仓库后创建并激活 virtualenv,再安装 torch 系列与 dflow 所需的辅助依赖。

    cd dalle-flow
    python3 -m virtualenv env
    source env/bin/activate && cd -
    pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu116
    pip install numpy tqdm pytorch_lightning einops numpy omegaconf
  5. 5装辅助仓库依赖

    以可编辑方式安装 latent-diffusion、stable-diffusion、SwinIR、glid-3-xl、clipseg 等子仓库。

    pip install https://github.com/crowsonkb/k-diffusion/archive/master.zip
    pip install git+https://github.com/AmericanPresidentJimmyCarter/stable-diffusion.git@v0.0.15
    pip install basicsr facexlib gfpgan
    pip install realesrgan
    pip install https://github.com/AmericanPresidentJimmyCarter/xformers-builds/raw/master/cu116/xformers-0.0.14.dev0-cp310-cp310-linux_x86_64.whl && 
    cd latent-diffusion && pip install -e . && cd -
    cd stable-diffusion && pip install -e . && cd -
    cd SwinIR && pip install -e . && cd -
    cd glid-3-xl && pip install -e . && cd -
    cd clipseg && pip install -e . && cd -
  6. 6下载 GLID-3-XL 权重

    使用 GLID-3-XL 时需下载 bert.pt、kl-f8.pt、finetune.pt 三个模型文件到该目录。

    cd glid-3-xl
    wget https://dall-3.com/models/glid-3-xl/bert.pt
    wget https://dall-3.com/models/glid-3-xl/kl-f8.pt
    wget https://dall-3.com/models/glid-3-xl/finetune.pt
    cd -
  7. 7安装 Flow 依赖

    回到 dalle-flow 目录安装 requirements.txt 以及指定版本的 jax。

    cd dalle-flow
    pip install -r requirements.txt
    pip install jax~=0.3.24

关键配置

配置项必填说明示例
DISABLE_DALLE_MEGA设为 1 时关闭 DALL·E-Mega 生成工作流,降低显存占用1
DISABLE_GLID3XL设为 1 时关闭 GLID-3 XL 扩散流程1
DISABLE_SWINIR设为 1 时关闭 SwinIR 超分辨率流程1
ENABLE_STABLE_DIFFUSION需先下载权重并挂载,才能手动启用 Stable Diffusion1
ENABLE_CLIPSEG手动启用 clipseg 分割能力1
ENABLE_REALESRGAN手动启用 RealESRGAN 超分能力1

如何确认成功

容器启动后终端显示运行界面,宿主机 51005 端口可访问即表示服务已就绪。

常见问题

Q:第一次启动很慢正常吗?

A:正常。首次运行需下载各模型权重,平均网速下约 10 分钟,之后借助挂载的缓存目录会快很多。

Q:提示显存不足或崩溃怎么办?

A:可传入 DISABLE_DALLE_MEGA、DISABLE_GLID3XL、DISABLE_SWINIR 等环境变量关闭部分工作流,避免 out-of-memory。

Q:Stable Diffusion 为什么用不了?

A:必须手动开启:先把权重放到 ldm/stable-diffusion-v1 并命名 model.ckpt,挂载进容器并设置 ENABLE_STABLE_DIFFUSION。

Q:Docker 里日志和进度条很简陋?

A:这是 Docker 容器终端限制导致的,不影响实际使用;如需更好的调试体验可选择本地原生运行。

Q:怎么换对外端口?

A:修改 -p 参数冒号前的部分,例如 -p 8080:51005,冒号后为 flow.yml 中定义的容器内端口 51005。

注意事项

  • README 顶部带有 deprecation 提示,项目已标记弃用,部署前请留意。
  • 使用 Stable Diffusion 前必须自行下载权重,README 未提供权重下载链接。
  • clipseg 与 RealESRGAN 需要正确设置缓存目录路径,通常是 $HOME/。
  • Docker 运行时日志、进度条与颜色输出会比本地运行弱一些,属正常现象。

核心亮点

  • 人类反馈循环设计,用户可逐步干预生成过程,结果更可控
  • 集成超分辨率,直接输出高清图像,省去后期处理
  • 基于流程化工作流,适合复杂创意需求的迭代探索

不足之处

  • 依赖OpenAI API,使用成本较高且需网络环境
  • 工作流步骤多,上手门槛略高于单次生成工具

适用场景

  • 设计师快速生成创意概念图并迭代优化
  • 非专业用户通过简单文本描述获得高质量配图
  • 内容创作者批量生成风格统一的插图素材

替代项目

Stable Diffusion WebUI、Midjourney、DALL·E 2 Playground

项目介绍

dalle-flow 是自动化工作流领域的开源项目,由 jina-ai 开发,2022 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,830)位列前 30%,在自动化工作流分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-19。本地部署,完全免费。

它主要面向的使用场景是:设计师快速生成创意概念图并迭代优化。同类可对比的替代方案包括 Stable Diffusion WebUI、Midjourney、DALL·E 2 Playground。

上一篇:auteur

下一篇:BrowserSynth

同类项目推荐

n8n 开源

拖拽搭建自动化流程,轻松接入 AI 与 400+ 应用,搞定重复工作。

Fair-code workflow automation platform with native AI capabilities. Combine visual b···

★ 205700 2026-08-10
feishu-docx 开源

让 AI 代理轻松读写飞书文档,双向转换 Markdown

Feishu/Lark Docs、Sheet、Bitable <-> Markdown | AI Agent-friendly knowledge base exp···

★ 261 2026-08-09
robotcode 开源

让 Robot Framework 拥有现代 IDE 体验,调试、补全、运行一气呵成。

Open Source Toolkit for Robot Framework, providing Language Server Protocol support,···

★ 300 2026-08-10
puppeteer 开源

用 JavaScript 轻松操控无头浏览器,搞定自动化测试与网页抓取。

JavaScript API for Chrome and Firefox

★ 95609 2026-08-10