diffusiondb

百万真实提示词数据,让 AI 生成更可控

DiffusionDB 是一个大规模文本到图像提示词画廊数据集,基于 Stable Diffusion 构建。它收集了数百万条真实的用户生成提示词及对应的生成图像,旨在解决提示词工程中缺乏真实数据、难以系统研究提示词与生成结果之间关系的问题。该数据集包含提示词、图像、超参数等丰富元数据,并提供了数据过滤、去重、分析工具,支持研究人员和开发者进行提示词分析、模型微调、图像检索等任务。其核心能力在于提供真实世界的大规模数据资源,推动生成式 AI 的可解释性和可控性研究。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1398
维护状态 低维护
是否开源
定价模式 free

项目数据

分类图像生成
开发团队poloclub
所属国家
定价模式free
价格说明开源数据集,MIT许可证,完全免费,可自行下载使用。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型ai-art,computer-vision,image-generation,prompt-engineering,stable-diffusion
GitHub 星标★ 1398
30天Star增速
HF 下载量
上线时间2022-10-10 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:入门 约 15 分钟 部署方式:命令行工具 6 步

环境要求

  • Python 环境(用于运行仓库中的 download.py 脚本)
  • 可访问 Hugging Face 数据集页面(数据集托管在 huggingface.co/datasets/poloclub/diffusiondb)
  • 充足磁盘空间:DiffusionDB 2M 约 1.6TB,Large 约 6.5TB,整套范围下载会提示需要约 1.7TB

安装与启动步骤

  1. 1获取下载脚本

    把项目仓库克隆到本地,进入目录后即可看到 README 中提到的 download.py 下载脚本。

    git clone https://github.com/poloclub/diffusiondb
    cd diffusiondb
  2. 2选择数据集子集

    2M 子集约 1.6TB,图像在 images/,元数据为 metadata.parquet;Large 约 6.5TB,图像在两个 large-part 目录。

  3. 3下载单个文件

    -i 后填 HuggingFace 文件名末尾的编号,脚本会自动补零并生成下载 URL。

    python download.py -i 23
  4. 4下载指定范围

    用 -i 作下界、-r 作上界批量下载;注意 -i 1 -r 2000 会下载整个数据集。

    python download.py -i 1 -r 2000
  5. 5指定下载目录

    用 -o 自定义输出目录;若移动了下载位置,需同步移动 images/ 下的 part .zip 文件或使用符号链接。

    python download.py -i 1 -r 2000 -o /home/$USER/datahoarding/etc
  6. 6下载后自动解压

    加 -z 让脚本在所有文件下载完成后再统一解压,避免下载与解压两个耗时过程相互干扰。

    python download.py -i 1 -r 2000 -z

关键配置

配置项必填说明示例
-i / --index要下载的单个文件编号,或范围下载时的下界23
-r / --range与 -i 配合使用时,范围下载的上界2000
-o / --output自定义输出目录,未设置时默认当前目录/home/$USER/datahoarding/etc
-z / --unzip下载完成后解压文件-z
-l / --large从 DiffusionDB Large 下载,默认为 DiffusionDB 2M-l

如何确认成功

运行后终端显示下载进度并在输出目录生成 part .zip 文件(加 -z 则解压出图像);配套 metadata.parquet 可用于对照提示词。

常见问题

Q:下载整套数据集需要多大空间?

A:使用 -i 1 -r 2000 会下载整个数据集,脚本会先要求你确认下载目标位置有约 1.7TB 空闲空间,空间不足请改用范围下载。

Q:怎么下载更大的 DiffusionDB Large?

A:在命令中加上 -l 或 --large 参数,不加则默认下载 DiffusionDB 2M 子集,两者提示词数量相近但图像规模差很多。

Q:下载下来的文件在哪里?

A:默认放在数据集 part .zip 文件所在的 images/ 目录;若用 -o 换位置,需要把这些 part 文件一起移动,或建立符号链接。

Q:解压应该在下载前还是下载后做?

A:脚本默认在全部文件下载完成后才解压,因为下载和解压都可能很耗时;直接加 -z 即可交给脚本自动处理。

Q:提示词和超参数在哪里?

A:在元数据表中:2M 子集对应 metadata.parquet,Large 子集对应 metadata-large.parquet,需与图像目录配合使用。

注意事项

  • README 只说明了 Hugging Face 数据集页面和 download.py 脚本用法,未提供 pip 依赖列表,运行脚本前请自行确认本地 Python 环境可用。
  • 命令示例中的 -i 1 -r 2000 等价于下载整个数据集,请勿在空间不足的机器上直接执行。
  • 本项目是数据集而非可部署的模型服务,不需要启动端口或容器。
  • 使用 -o 更换下载目录时,记得同时处理 images/ 下的 part .zip 文件或改用符号链接。

核心亮点

  • 包含数百万真实用户提示词和图像,数据规模大且贴近实际使用场景
  • 提供详细的元数据(如超参数、采样器),便于多维度分析
  • 附带数据过滤和去重工具,方便研究人员快速清洗数据

不足之处

  • 数据基于 Stable Diffusion 特定版本,可能不适用于其他模型
  • 文档/社区待观察

适用场景

  • 研究提示词工程对生成图像的影响
  • 训练或微调文本到图像模型的提示词理解能力
  • 构建图像检索或推荐系统的基准数据集

替代项目

LAION-5B、JourneyDB、Midjourney Dataset

项目介绍

diffusiondb 是数据集领域的开源项目,由 poloclub 开发,2022 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,398)位列前 30%,在数据集分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。开源数据集,MIT许可证,完全免费,可自行下载使用。

它主要面向的使用场景是:研究提示词工程对生成图像的影响。同类可对比的替代方案包括 LAION-5B、JourneyDB、Midjourney Dataset。

上一篇:ICASSP-2023-24-Papers

下一篇:HumanArt

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09