DALLE2-pytorch

用 PyTorch 复现 DALL-E 2,轻松训练自己的文本生图模型

DALLE2-pytorch 是 OpenAI 的 DALL-E 2 文本生成图像模型的非官方 PyTorch 实现,由开发者 lucidrains 维护。它解决了研究者无法直接访问 OpenAI 闭源模型的问题,提供了完整的训练和推理代码,支持从文本描述生成高质量图像。核心能力包括 CLIP 文本编码、先验模型(prior)和扩散解码器(decoder)的完整实现,支持无条件生成、文本条件生成以及图像编辑(inpainting)等功能。项目代码模块化清晰,易于扩展和修改,并提供了详细的文档和示例。由于是社区实现,它允许用户在自有数据上训练或微调模型,推动了文本生成图像技术的普及和二次开发。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 11302
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队lucidrains
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型artificial-intelligence,deep-learning,text-to-image
GitHub 星标★ 11302
30天Star增速
HF 下载量
上线时间2022-04-07 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:高级 约 10 分钟 部署方式:库/依赖 4 步

环境要求

  • 已安装 Python 与 pip(README 使用 pip 安装)
  • 建议具备 NVIDIA GPU 与 CUDA 环境(README 示例代码使用 .cuda())
  • 需自备训练数据与算力,README 只给出训练流程,未提供预训练权重或数据集下载
  • 训练 CLIP 阶段建议配合 x-clip 或 open_clip 等社区复现项目

安装与启动步骤

  1. 1安装本库

    使用 pip 安装 dalle2-pytorch,这是 README 中唯一给出的安装命令;建议在独立虚拟环境中执行以免污染全局环境。

    pip install dalle2-pytorch
  2. 2安装 CLIP 依赖

    README 说明本仓库以 x-clip 为例演示集成,训练三步流程中最关键的是 CLIP,可先安装 x-clip 作为文本/图像编码器。

    pip install x-clip
  3. 3验证可导入

    导入 README 中演示的 CLIP 类,能正常导入即说明包安装成功;若报错请检查 Python 与 pip 是否对应同一环境。

    python -c "from dalle2_pytorch import CLIP; print('ok')"
  4. 4按三步流程训练

    README 指出训练分三步:先训 CLIP,再训 prior 网络,最后训扩散解码器;本仓库只实现了 diffusion prior 变体,需自行准备数据与算力。

关键配置

配置项必填说明示例
dim_text是CLIP 文本嵌入维度,示例中为 512512
dim_image是CLIP 图像嵌入维度,示例中为 512512
num_text_tokens是文本 tokenizer 词表大小,示例为 4940849408
text_seq_len是文本序列最大长度,示例为 256256
use_all_token_embeds否是否启用细粒度对比学习 FILIPTrue
decoupled_contrastive_learning否是否使用解耦对比学习 DCL 目标函数True

如何确认成功

运行 python -c "from dalle2_pytorch import CLIP",无报错即安装成功;训练是否有效需观察 CLIP 与 prior 的 loss 变化。

常见问题

Q:这是 OpenAI 官方的 DALL-E 2 吗?

A:不是。这是 lucidrains 维护的非官方 PyTorch 复现,README 明确说明自 2022/5/23 起该模型已不再是 SOTA,后续方向转向 Imagen 架构。

Q:只执行 pip install 就能文字生成图片吗?

A:不能。本仓库是训练与建模代码库,README 给出的三步训练流程(CLIP、prior、decoder)需要自备数据和算力,安装只是第一步。

Q:必须使用 GPU 吗?

A:README 示例代码中所有模型都调用了 .cuda(),因此建议在 NVIDIA GPU + CUDA 环境下运行,CPU 训练不现实。

Q:prior 网络有哪几种实现?

A:README 说明 prior 可以是自回归 transformer 或扩散网络,本仓库只实现了性能更好的扩散 prior 变体。

Q:CLIP 部分要怎么训?

A:README 建议使用 x-clip 包,或加入 LAION Discord 中已在进行的大量复现工作(如 open_clip)。

注意事项

  • 本项目是非官方复现,README 声明其自 2022/5/23 起已不是 SOTA,新项目建议参考 Imagen 架构实现。
  • 本仓库仅构建 diffusion prior 变体,未提供自回归 prior 实现。
  • README 未给出预训练权重下载地址、端口或服务启动方式,任何此类命令都不要自行添加。
  • 示例代码片段在 README 中出现重复(DiffusionPriorNetwork 定义多次),实际使用时只保留一份即可。

核心亮点

  • 完整复现 DALL-E 2 核心架构,包含 CLIP、先验和扩散解码器,代码结构清晰
  • 支持多种训练模式(无条件、文本条件、图像编辑),并提供了预训练权重加载
  • 活跃维护,社区贡献多,兼容最新 PyTorch 版本,易于集成到现有项目

不足之处

  • 训练资源需求高,个人开发者难以复现完整模型效果
  • 文档/社区待观察:部分高级功能(如注意力控制)示例不足

适用场景

  • 学术研究:快速验证 DALL-E 2 相关算法改进
  • 创意设计:生成概念图、插画或辅助设计
  • 教育学习:学习扩散模型和文本生成图像的实现细节

替代项目

OpenAI DALL-E 2(官方闭源)、Stable Diffusion、Imagen-pytorch

项目介绍

DALLE2-pytorch 是开源模型领域的开源项目,由 lucidrains 开发,2022 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(11,302)位列前 5%,在开源模型分类的 424 个项目里位列前 7%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:学术研究:快速验证DALL-E2相关算法改进。同类可对比的替代方案包括 OpenAI DALL-E 2(官方闭源)、Stable Diffusion、Imagen-pytorch。

上一篇:LLMPapers

下一篇:Kandinsky-2

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
awesome-ltx2 开源

找齐 LTX-2 模型、工作流和 LoRA,一键上手视频生成。

All available LTX-2 models, encoders, workflows, LoRAs for ComfyUI

★ 593 2026-08-10