deep-daze

输入一句话,命令行生成艺术图像

deep-daze 是一个基于 OpenAI CLIP 和 Siren 隐式神经表示网络的命令行工具,用于将文本描述转化为图像。它解决了文本到图像生成中语义对齐和图像质量平衡的问题,核心能力包括:通过 CLIP 模型理解文本语义,利用 Siren 网络生成高分辨率图像,并支持多种预训练模型和自定义参数。用户只需输入一句话,即可生成对应的艺术化图像,无需编写代码。该项目由 Twitter 用户 advadnoun 首创技术思路,deep-daze 将其工程化,提供了简洁的 CLI 接口,适合快速实验和创意探索。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4313
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队lucidrains
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型artificial-intelligence,deep-learning,implicit-neural-representation,multi-modality,siren,text-to-image,transformers
GitHub 星标★ 4313
30天Star增速
HF 下载量
上线时间2021-01-17 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 15 分钟 部署方式:命令行工具 5 步

环境要求

  • Python 环境(README 预设已安装 Python)
  • Nvidia GPU 或 AMD GPU
  • 显存推荐 16GB,最低 4GB(需使用非常低的参数设置)
  • 可联网下载依赖与预训练模型

安装与启动步骤

  1. 1确认显卡条件

    README 明确要求使用 Nvidia 或 AMD GPU,推荐 16GB 显存;最低 4GB,但必须配合非常低的参数设置。

  2. 2安装 deep-daze

    通过 pip 从 PyPI 安装 deep-daze,会一并拉取 CLIP、Siren 相关依赖。

    pip install deep-daze
  3. 3Windows 下安装

    Windows 用户打开命令提示符并进入当前 Python 版本所在目录,再执行同一条 pip 安装命令。

    pip install deep-daze
  4. 4生成第一张图

    使用 imagine 命令并传入英文文本描述,程序会基于 CLIP 语义迭代生成对应图像。

    imagine "a house in the forest"
  5. 5按显存调参

    显存紧张时在 Python 调用中调小 image_width、num_layers、batch_size,并增大 gradient_accumulate_every。

    imagine = Imagine(
        text=text,
        image_width=256,
        num_layers=16,
        batch_size=1,
        gradient_accumulate_every=16
    )

关键配置

配置项必填说明示例
text是要生成的图像所对应的文本描述a house in the forest
num_layers否Siren 网络层数,越大越吃显存42
batch_size否批大小,显存越大可设置越大64
gradient_accumulate_every否梯度累积步数,低批大小时需增大以补偿1
image_width否生成图像宽度,显存不足时降低256

如何确认成功

执行 imagine 命令后能进入生成循环、不报错且不出现显存不足,即表示安装与运行正常。

常见问题

Q:显存不足 4GB 怎么办?

A:把 image_width 降到 256、num_layers 设为 16、batch_size 设为 1,并把 gradient_accumulate_every 增大到 16,以补偿低批大小带来的损失。

Q:16GB 显存推荐哪些参数?

A:可使用 num_layers=42、batch_size=64、gradient_accumulate_every=1,README 称此时仍有一定余量。

Q:显存一般时如何设置?

A:中间档配置为 num_layers=24、batch_size=16、gradient_accumulate_every=2。

Q:没有 GPU 能运行吗?

A:README 明确要求 Nvidia 或 AMD GPU,最低显存 4GB,否则无法按说明运行。

Q:Windows 如何安装?

A:打开命令提示符并进入当前 Python 版本所在目录,执行 pip install deep-daze 即可。

注意事项

  • 本项目为命令行工具,安装后通过 imagine 命令直接使用,无需编写代码。
  • 显存是关键限制条件:推荐 16GB,最低 4GB 且必须降低图像宽度与网络层数。
  • 低 batch size 会带来损失,README 建议通过增大 gradient_accumulate_every 来补偿。
  • README 未说明生成图像的保存路径与文件名,实际输出位置请以运行时的终端提示为准。

核心亮点

  • 基于 CLIP 语义对齐,文本理解准确,生成图像与描述高度相关
  • 使用 Siren 隐式网络,支持高分辨率输出,图像细节丰富
  • 命令行工具,安装简单,开箱即用,无需深度学习背景

不足之处

  • 生成速度较慢,单张图像需要较长时间迭代
  • 对复杂文本描述支持有限,易产生语义歧义
  • 文档/社区待观察

适用场景

  • 快速生成概念图或插画灵感
  • 艺术创作与风格实验
  • 教学演示文本到图像生成原理

替代项目

DALL-E、Stable Diffusion、VQGAN-CLIP

项目介绍

deep-daze 是图像领域的开源项目,由 lucidrains 开发,2021 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(4,313)位列前 10%,在图像分类的 837 个项目里位列前 6%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:快速生成概念图或插画灵感。同类可对比的替代方案包括 DALL-E、Stable Diffusion、VQGAN-CLIP。

上一篇:DALLE-pytorch

下一篇:PromptEnhancer

同类项目推荐

satori 开源

网页代码一键变高清图,放大不糊,不用截图

Enlightened library to convert HTML and CSS to SVG

★ 13967 2026-08-09
C2GAN 开源

用关键点精准控制图像生成,让AI画出你想要的结构

[ACM MM 2019 Oral] Cycle In Cycle Generative Adversarial Networks for Keypoint-Guide···

★ 70 2026-08-09
ComfyUI 开源

像搭积木一样连节点,生图流程自己搭

The most powerful and modular diffusion model GUI, api and backend with a graph/node···

★ 134493 2026-08-09