awesome-public-datasets

按主题找公开数据集,省去到处搜的麻烦

awesome-public-datasets 是一个以主题分类整理的公开数据集清单,核心价值在于把散落在政府门户、科研机构和开源社区的高质量开放数据集中到一处,按农业、生物、气候、经济、教育、能源、金融、医疗、图像、机器学习等几十个主题归类,方便数据科学家、机器学习工程师、记者和学生快速找到可直接下载或引用的数据源。项目本身不是数据托管平台,而是一份持续维护的索引,每条记录通常包含数据集名称、简要说明和官方链接,覆盖从政府开放数据到学术基准集的多种来源。它解决的是“找数据难、来源分散、质量参差”的问题,让使用者不必在多个站点之间反复搜索,就能按领域定位到可用数据,是数据项目立项、模型训练和数据分析前期调研的常用参考入口。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 79058
维护状态 活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队awesomedata
所属国家
定价模式free
价格说明开源免费的数据集清单
访问状态
是否开源
开源协议MIT
主要语言
技术栈/模型aaron-swartz,awesome-public-datasets,datasets,opendata
GitHub 星标★ 79058
30天Star增速
HF 下载量
上线时间2014-11-20 00:00:00
最近更新2026-09-20 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-21
浏览次数0

使用教程

难度:入门 约 5 分钟 部署方式:本地安装 6 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 可访问 GitHub 的网络环境
  • 已安装 git(用于克隆清单仓库)
  • 可打开 Markdown 文件的编辑器或浏览器
  • (可选)Slack 账号,用于加入官方社区获取更新

安装与启动步骤

  1. 1克隆清单仓库

    把数据集索引仓库拉到本地,README 即为完整清单。仓库体量很小,秒级完成。

    git clone https://github.com/awesomedata/awesome-public-datasets.git
  2. 2进入目录

    切换到克隆下来的仓库目录,准备查看清单文件。

    cd awesome-public-datasets
  3. 3按主题浏览清单

    打开 README,按农业、生物、气候、经济、教育、能源、金融、医疗、图像、机器学习等主题定位条目。

  4. 4跳转官方来源

    清单每条记录含数据集名称、简要说明和官方链接,点击链接前往原始站点下载或引用。

  5. 5贡献请走 apd-core

    README 由 apd-core 自动生成,不要直接改本仓库;新增/修正条目请按 apd-core 的 CONTRIBUTING.md 提交。

    git clone https://github.com/awesomedata/apd-core.git
  6. 6加入社区获取更新

    通过 README 中的邀请链接加入 awesomedataworld Slack,第一时间获取高质量数据更新。

如何确认成功

打开 README.md 能看到按主题分类的数据集条目列表,即为获取成功。

常见问题

Q:这些数据集都是免费的吗?

A:README 说明大多数数据集是免费的,但也有一部分并非免费,使用前请到官方来源确认授权和收费情况。

Q:可以直接修改这个仓库的 README 吗?

A:不可以。README 由 apd-core 自动生成,README 中明确提示不要直接修改,贡献需走 apd-core 项目的 CONTRIBUTING.md。

Q:项目本身托管数据吗?

A:不托管。它只是一份持续维护的公开数据集索引,每条记录包含名称、简要说明和官方链接,数据需回到原始来源下载。

Q:如何第一时间获得数据更新?

A:加入官方 Slack 社区 awesomedataworld,README 中提供了共享邀请链接。

注意事项

  • 本项目是索引清单,不是数据托管平台,下载实际数据需访问各官方来源。
  • README 由 apd-core 自动生成,直接修改本仓库无效。
  • 部分数据集非免费,商用前请核实许可协议。
  • 项目孵化于上海交通大学 OMNILab,现归属 BaiYuLan 开源 AI 社区。

核心亮点

  • 按主题分类清晰,覆盖农业、医疗、金融、气候等几十个领域,检索路径直观
  • 收录大量政府与学术机构的高质量开放数据集,来源相对可靠
  • 星标近8万,社区关注度高,长期有贡献者补充和修正链接

不足之处

  • 仅提供链接索引,不托管数据,链接失效或迁移时需自行排查
  • 条目质量依赖社区维护,部分分类下数据集的更新频率和描述详细程度不一致

适用场景

  • 机器学习项目启动前调研可用的训练数据集
  • 数据分析师为行业报告寻找公开统计数据源
  • 学生或记者做课题时快速定位权威开放数据入口

替代项目

datasets(huggingface/datasets)、Kaggle Datasets

项目介绍

awesome-public-datasets 是数据集领域的开源项目,由 awesomedata 开发,2014 年首次发布。

在全站 12,822 个收录项目中,它的 GitHub 星标数(79,058)位列前 1%,在数据集分类的 278 个项目里位列前 1%。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-20。开源免费的数据集清单。

它主要面向的使用场景是:机器学习项目启动前调研可用的训练数据集。同类可对比的替代方案包括 datasets(huggingface/datasets)、Kaggle Datasets。

上一篇:dataset

下一篇:datasette

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10496 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1643 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3395 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09