min-dalle

轻量跑通文本生图,普通显卡也能快速出图

min(DALL·E) 是一个将 DALL·E Mini 快速移植到 PyTorch 的精简实现,旨在以最少的代码和依赖复现文本生成图像的核心能力。它解决了原始 DALL·E Mini 在推理速度慢、部署复杂的问题,通过优化模型结构和推理流程,让开发者能在普通消费级 GPU 上快速生成图像。项目核心能力包括:支持中英文文本提示、提供简洁的 Python API、内置预训练权重自动下载、以及支持从文本生成多张候选图像。其代码结构清晰,便于研究者理解扩散模型和 VQGAN 的协同工作原理,也适合作为二次开发的基线。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3488
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队kuprel
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,可自由使用和部署,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型artificial-intelligence,deep-learning,pytorch,text-to-image
GitHub 星标★ 3488
30天Star增速
HF 下载量
上线时间2022-06-27 00:00:00
最近更新2026-09-20 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 15 分钟 部署方式:库/依赖 4 步

环境要求

  • Python 环境(可直接执行 pip 与 python)
  • PyTorch(torch)已安装,GPU 可选,device 支持 "cuda" 或 "cpu"
  • 其余依赖 numpy、requests、pillow、torch 由 min-dalle 自动安装
  • 如需 GPU 加速,建议使用 Colab T4/P100/A10G 等级显卡(README 给出的参考)

安装与启动步骤

  1. 1安装 min-dalle

    README 给出的唯一安装方式,通过 pip 从 PyPI 安装该库及其依赖。

    pip install min-dalle
  2. 2初始化模型

    只加载一次模型参数并复用;首次运行会把所需权重自动下载到 models_root 目录。

    import torch
    from min_dalle import MinDalle
    
    model = MinDalle(
        models_root='./pretrained',
        dtype=torch.float32,
        device='cuda',
        is_mega=True,
        is_reusable=True
    )
  3. 3生成图像

    初始化完成后可反复调用 generate_image,传入英文或中文提示词;seed 用正数可复现结果。

    image = model.generate_image(
        text='Nuclear explosion broccoli',
        seed=-1,
        grid_size=4,
        is_seamless=False,
        temperature=1,
        top_k=256,
        supercondition_factor=32,
        is_verbose=False
    )
  4. 4显示结果

    generate_image 返回图像对象,README 用 display 直接展示;如需保存可用 PIL 的 save 方法。

    display(image)

关键配置

配置项必填说明示例
models_root是预训练权重的存放目录,不存在时会自动下载./pretrained
dtype是推理精度,float16 可省显存,Ampere 显卡可用 bfloat16torch.float32
device是运行设备,可选 "cuda" 或 "cpu"cuda
is_mega是是否使用 DALL·E Mega 权重True
is_reusable是是否复用已加载的模型参数以生成多张图True
supercondition_factor否值越大越贴合文本,但图像多样性越低32

如何确认成功

模型初始化打印完成后,调用 generate_image 返回图像并用 display(image) 正常显示,即部署成功。

常见问题

Q:显存不够怎么办?

A:把 dtype 设为 torch.float16 以节省 GPU 显存;若为 Ampere 架构显卡可改用 torch.bfloat16。

Q:没有 GPU 可以运行吗?

A:可以,把 device 设为 "cpu" 即可,但生成速度会明显慢于 GPU。

Q:每次生成结果都不一样怎么办?

A:给 generate_image 传入一个正数 seed 即可复现结果;默认 seed=-1 表示随机。

Q:权重文件需要手动下载吗?

A:不需要,初始化 MinDalle 时所需的模型会自动下载到 models_root 指定的目录。

Q:生成图像与文本提示不太一致?

A:提高 supercondition_factor 的取值可让结果更贴合文本,但生成图像的多样性会变窄。

注意事项

  • 模型参数只需加载一次,请复用同一个 model 对象多次调用 generate_image。
  • 每次图像 token 都从 top_k 个最可能的 token 中采样,logits 会先减最大值再除以 temperature。
  • is_seamless 为 true 时,图像网格会在 token 空间而非像素空间平铺。
  • README 给出参考耗时:Colab T4 约 55 秒、P100 约 33 秒、Hugging Face A10G 约 15 秒生成 3x3 网格。

核心亮点

  • 推理速度快,比原版 DALL·E Mini 显著提升,适合快速原型验证
  • 代码极简,依赖少,易于阅读和二次开发
  • 自动下载预训练权重,开箱即用,无需手动配置模型

不足之处

  • 图像生成质量相比 DALL·E 2 或 Stable Diffusion 仍有差距
  • 文档/社区待观察

适用场景

  • 学术研究:快速理解文本到图像生成的基础流程
  • 教学演示:在有限算力下展示生成效果
  • 轻量应用:作为低成本文本生图功能的嵌入式模块

替代项目

DALL·E Mini (craiyon)、Stable Diffusion、ru-dalle

项目介绍

min-dalle 是图像领域的开源项目,由 kuprel 开发,2022 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(3,488)位列前 30%,在图像分类的 837 个项目里位列前 7%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-20。MIT许可证,可自由使用和部署,无付费版本。

它主要面向的使用场景是:学术研究:快速理解文本到图像生成的基础流程。同类可对比的替代方案包括 DALL·E Mini (craiyon)、Stable Diffusion、ru-dalle。

上一篇:PromptEnhancer

下一篇:dalle-playground

同类项目推荐

satori 开源

网页代码一键变高清图,放大不糊,不用截图

Enlightened library to convert HTML and CSS to SVG

★ 13967 2026-08-09
C2GAN 开源

用关键点精准控制图像生成,让AI画出你想要的结构

[ACM MM 2019 Oral] Cycle In Cycle Generative Adversarial Networks for Keypoint-Guide···

★ 70 2026-08-09
ComfyUI 开源

像搭积木一样连节点,生图流程自己搭

The most powerful and modular diffusion model GUI, api and backend with a graph/node···

★ 134493 2026-08-09