big-sleep

输入一句话,用 CLIP 引导 BigGAN 生成图像

big-sleep 是一个基于命令行的文本生成图像工具,由 OpenAI 的 CLIP 模型和 BigGAN 生成对抗网络结合实现。它解决的核心问题是:在没有配对文本-图像数据集的情况下,如何利用预训练模型实现文本到图像的生成。其原理是通过 CLIP 计算文本与生成图像的语义相似度,并以此作为损失函数来迭代优化 BigGAN 的输入潜向量,从而生成与文本描述匹配的图像。该工具提供了简洁的 CLI 接口,用户只需输入一句文本描述,即可生成对应的图像。它支持自定义迭代步数、图像尺寸等参数,并能在普通 GPU 上运行。作为早期探索性项目,它展示了 CLIP 在引导生成模型方面的巨大潜力,为后续的文本-图像生成研究提供了重要参考。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2573
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队lucidrains
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,需自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型artificial-intelligence,deep-learning,generative-adversarial-networks,multimodality,text-to-image
GitHub 星标★ 2573
30天Star增速
HF 下载量
上线时间2021-01-18 00:00:00
最近更新2026-08-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 5 步

环境要求

  • 一台拥有 GPU 的机器(README 明确该仓库面向拥有 GPU 的用户)
  • 可用的 Python 环境与 pip
  • 终端(命令行)环境

安装与启动步骤

  1. 1确认 GPU 环境

    README 说明该项目面向拥有 GPU 的用户,请在具备可用 GPU 的机器上操作,否则无法按预期运行。

  2. 2安装 big-sleep

    使用 pip 从 PyPI 安装 big-sleep 包,README 给出的唯一安装命令就是这一条。

    pip install big-sleep
  3. 3切换到输出目录

    README 说明图片会保存到执行命令时所在的目录,所以先 cd 到你希望存放图片的文件夹。

    cd /your/path
  4. 4用文字生成图像

    用 dream 命令加一段英文描述即可生成图像,命令会直接在当前目录输出结果。

    dream "a pyramid made of ice"
  5. 5查看生成结果

    列出当前目录内容,确认图像文件已经生成在命令执行的目录中。

    ls

如何确认成功

dream 命令执行完成后,在调用该命令的目录下能找到生成的图像文件。

常见问题

Q:没有 GPU 可以运行吗?

A:README 明确说这个仓库是给拥有 GPU 的人使用的,并未给出 CPU 运行方式,因此不建议在无 GPU 环境下尝试。

Q:生成的图片保存在哪里?

A:README 说明图片会保存到执行 dream 命令时所在的目录,即你在哪个文件夹运行命令,图片就出现在哪里。

Q:必须把提示词写成英文吗?

A:README 中的全部示例(如 a pyramid made of ice)都是英文文本,没有提到中文提示词的支持情况。

Q:有没有图形界面或在线版本?

A:该项目本身只有终端一行命令的用法;README 另外提供了官方与用户制作的 Colab notebook 链接,可在浏览器中运行。

注意事项

  • README 只给出 pip 安装与 dream 一条命令,未列出任何可调参数、端口或配置文件。
  • 运行前先 cd 到目标文件夹,否则图片会散落在你当前所在的目录。
  • README 中的示例提示词包括 a pyramid made of ice、cosmic love and attention、demon fire 等,可直接替换引号内的文字。
  • 除命令行外,README 还提供了几个 Colab notebook 入口,适合没有本地 GPU 时在线试用。

核心亮点

  • 命令行操作简单,一条命令即可完成文本到图像生成
  • 基于 CLIP+BigGAN 的经典组合,技术思路清晰,易于理解
  • 支持自定义迭代步数和图像尺寸,灵活控制生成过程

不足之处

  • 生成图像分辨率较低,细节和清晰度有限
  • 对复杂文本描述的理解能力有限,生成结果可能不准确
  • 文档/社区待观察

适用场景

  • 快速生成概念草图或灵感图
  • 教学演示 CLIP 引导生成原理
  • 作为实验基础,探索多模态生成

替代项目

DALL-E、Stable Diffusion、DeepDaze

项目介绍

big-sleep 是图像领域的开源项目,由 lucidrains 开发,2021 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,573)位列前 30%,在图像分类的 839 个项目里位列前 8%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-23。MIT许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:快速生成概念草图或灵感图。同类可对比的替代方案包括 DALL-E、Stable Diffusion、DeepDaze。

上一篇:VQGAN-CLIP

下一篇:carefree-creator

同类项目推荐

satori 开源

网页代码一键变高清图,放大不糊,不用截图

Enlightened library to convert HTML and CSS to SVG

★ 13967 2026-08-09
C2GAN 开源

用关键点精准控制图像生成,让AI画出你想要的结构

[ACM MM 2019 Oral] Cycle In Cycle Generative Adversarial Networks for Keypoint-Guide···

★ 70 2026-08-09
ComfyUI 开源

像搭积木一样连节点,生图流程自己搭

The most powerful and modular diffusion model GUI, api and backend with a graph/node···

★ 134493 2026-08-09