datasets

一行代码加载数百个机器学习数据集,省去下载清洗烦恼

TFDS(TensorFlow Datasets)是一个开源的机器学习数据集库,旨在为 TensorFlow、JAX 等框架提供即用型数据集。它解决了研究人员和开发者获取、预处理和标准化数据集的痛点,通过统一的数据加载接口,让用户无需手动下载、解析和清洗数据。核心能力包括:支持数百个公开数据集的快速加载、自动下载与缓存管理、与 tf.data 和 JAX 无缝集成、提供版本控制和数据切分功能,以及支持自定义数据集构建。项目采用 Python 编写,基于 Apache 2.0 协议,由 TensorFlow 社区维护,活跃度高,适合从学术研究到工业落地的多种场景。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4591
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类数据集
开发团队tensorflow
所属国家
定价模式free
价格说明开源库,完全免费,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型data,dataset,datasets,jax,machine-learning,numpy,tensorflow
GitHub 星标★ 4591
30天Star增速
HF 下载量
上线时间2018-09-10 00:00:00
最近更新2026-09-21 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数10

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

环境要求

  • Python 环境(README 示例代码为 Python)
  • pip 包管理器(用于安装 tensorflow-datasets)
  • TensorFlow(README 示例中 import tensorflow as tf)
  • 可联网环境(首次加载数据集需要下载)

安装与启动步骤

  1. 1安装 TFDS 库

    README 明确给出安装命令,在终端执行即可。若在 Colab 中运行,命令前需加感叹号。

    pip install tensorflow-datasets
  2. 2验证导入成功

    导入 tensorflow_datasets 与 tensorflow,确认包已正确安装、没有报错。

    python -c "import tensorflow_datasets as tfds
    import tensorflow as tf
    print(tfds.__name__)"
  3. 3加载 MNIST 数据

    用 tfds.load 构造 tf.data.Dataset。split 指定切分,as_supervised 返回(图,标签)元组。

    python -c "import tensorflow_datasets as tfds
    ds = tfds.load('mnist', split='train', as_supervised=True, shuffle_files=True)
    print(ds)"
  4. 4搭建输入管道

    在数据集上链式调用 shuffle、batch、prefetch、take,构建可直接喂给模型的输入管道。

    python -c "import tensorflow_datasets as tfds
    ds = tfds.load('mnist', split='train', as_supervised=True, shuffle_files=True)
    ds = ds.shuffle(1000).batch(128).prefetch(10).take(5)
    for image, label in ds:
      pass"

关键配置

配置项必填说明示例
split是指定加载的数据切分,如 traintrain
as_supervised否为 True 时返回 (特征, 标签) 元组True
shuffle_files否是否打乱底层文件读取顺序True

如何确认成功

运行 tfds.load('mnist', split='train') 能正常返回数据集对象并完成迭代、无报错,即表示安装与加载成功。

常见问题

Q:我该从哪里开始使用 TFDS?

A:README 强烈建议先阅读官方 getting started guide,也可在提供的 Colab notebook 中交互式体验。

Q:有哪些数据集可以使用?

A:官方文档提供了全部可用数据集目录(catalog overview),README 给出了链接,可按需查阅。

Q:在 Colab 里怎么安装?

A:README 示例中已给出注释形式的命令 !pip install tensorflow-datasets,去掉注释直接运行单元格即可。

Q:加载数据集的接口是什么?

A:核心接口是 tfds.load,它返回 tf.data.Dataset,可继续用 shuffle/batch/prefetch 等方法构建管道。

注意事项

  • README 建议先阅读官方 getting started guide,再动手安装使用。
  • 官方提供 Colab notebook,可在线交互式试跑示例代码,无需本地环境。
  • tfds.load 返回的是 tf.data.Dataset 对象,后续处理遵循 tf.data 的常规用法。
  • README 未提供自定义缓存路径、代理等高级配置说明,需要时请查阅官方文档。

核心亮点

  • 统一API,一行代码加载数据集,支持TensorFlow和JAX
  • 内置数百个主流数据集,覆盖图像、文本、音频等多领域
  • 自动处理下载、缓存和版本管理,保证数据可复现性

不足之处

  • 部分数据集加载依赖网络,离线环境使用受限
  • 文档对自定义数据集构建的示例不够丰富

适用场景

  • 机器学习模型训练前的数据准备与快速迭代
  • 学术研究中复现论文实验,快速获取标准数据集
  • 教学演示,无需手动下载数据即可演示模型效果

替代项目

Hugging Face Datasets、Torchvision Datasets、OpenML

项目介绍

datasets 是数据集领域的开源项目,由 tensorflow 开发,2018 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(4,591)位列前 10%,在数据集分类的 279 个项目里位列前 9%。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-21。开源库,完全免费,无付费版本。

它主要面向的使用场景是:机器学习模型训练前的数据准备与快速迭代。同类可对比的替代方案包括 Hugging Face Datasets、Torchvision Datasets、OpenML。

上一篇:browser-compat-data

下一篇:pandas-datareader

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09