open-data-registry

一键发现并定位 AWS 上的公开数据集

open-data-registry 是 AWS 官方维护的公开数据集注册表,用 Python 实现。它把散落在 AWS 各处的开放数据集(Open Data)集中登记,提供统一的元数据描述、检索入口和访问方式说明,解决研究者、数据工程师和开发者难以发现、定位和复用 AWS 上公开数据的问题。核心能力包括:以结构化清单形式记录数据集名称、描述、维护方、许可、S3 存储位置、访问方式等字段;支持通过 GitHub 仓库协作提交和更新数据集条目;可作为程序化查询的数据源,方便下游工具或应用批量获取数据集目录。项目本身不托管数据,而是做索引与元数据管理,因此体量轻、易扩展,适合作为数据发现层的基础设施。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1784
维护状态 活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队awslabs
所属国家
定价模式free
价格说明免费公开访问,数据集本身可能产生AWS费用
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 1784
30天Star增速
HF 下载量
上线时间2017-08-07 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-21
浏览次数0

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • 已安装 git
  • 本地有文本编辑器,能编辑 YAML 文件
  • Python 环境(用于按需读取/处理 YAML 元数据)
  • 能访问 GitHub 仓库 https://github.com/awslabs/open-data-registry

安装与启动步骤

  1. 1克隆仓库

    把 open-data-registry 仓库下载到本地,仓库本身只存放数据集元数据,不托管实际数据。

    git clone https://github.com/awslabs/open-data-registry.git
  2. 2进入数据集目录

    所有数据集条目都以 YAML 文件形式存放在 datasets 目录下,先查看已有条目作为参考。

    cd open-data-registry
    ls datasets
  3. 3编写 YAML 元数据

    按 README 给出的字段结构新建一个 YAML 文件,填写名称、描述、维护方、许可、资源 ARN 等。

    vi datasets/my-dataset.yaml
  4. 4提交并推送

    把新增的 YAML 文件提交到自己的分支并推送到 GitHub,随后向主仓库发起 Pull Request。

    git checkout -b add-my-dataset
    git add datasets/my-dataset.yaml
    git commit -m "Add my dataset"
    git push origin add-my-dataset
  5. 5在官网核对

    PR 合并后,条目会出现在 Registry of Open Data on AWS 浏览器和托管的 YAML 列表中,可自行检索确认。

关键配置

配置项必填说明示例
Name数据集名称My Open Dataset
Description数据集内容与用途的简要描述A dataset of example records
Documentation数据集文档链接https://example.com/docs
Contact联系人信息,便于使用者咨询data@example.com
ManagedBy数据集的维护方(非 AWS,由各组织或个人维护)Example Organization
UpdateFrequency数据更新频率Monthly

如何确认成功

本地 datasets 目录中出现新增的 YAML 文件,且 PR 合并后能在 https://registry.opendata.aws/ 检索到该数据集。

常见问题

Q:这些数据是 AWS 提供的吗?

A:不是。注册表中的数据集可通过 AWS 资源访问,但由各政府机构、研究者、企业和个人拥有并维护,AWS 只提供索引与元数据。

Q:如何新增一个数据集?

A:在仓库 datasets 目录下按 README 给出的 YAML 结构新增元数据文件,提交并推送后向仓库发起 Pull Request。

Q:数据集存在哪里?

A:项目本身不托管数据,只记录元数据;实际数据位于各数据集自己的 AWS 资源(如 S3)中,位置通过 Resources 字段的 ARN 说明。

Q:这些 YAML 文件有什么用?

A:用于生成 Registry of Open Data on AWS 浏览器、一份汇总全部条目的托管 YAML 文件,以及每个数据集各自的托管 YAML 文件。

注意事项

  • README 未提供 pip 安装或 Docker 启动方式,该项目是元数据仓库而非可运行服务,不要臆造启动命令。
  • YAML 字段必须与 README 给出的结构保持一致,字段缺失或拼写错误可能导致条目无法被正确生成。
  • 提交前建议先阅读 datasets 目录中已有条目的写法,保持格式统一。
  • 本注册表的数据集由第三方维护,使用时请自行核对许可与引用要求。

核心亮点

  • 由 AWS 官方维护,数据集条目权威且持续更新
  • 以结构化元数据登记数据集,便于程序化检索和集成
  • 基于 GitHub 协作,社区可提交和修正数据集信息

不足之处

  • 仅覆盖 AWS 平台上的公开数据集,范围有限
  • 项目以元数据索引为主,缺少开箱即用的检索界面或 SDK

适用场景

  • 数据科学家快速查找可用的公开数据集用于建模
  • 数据工程师批量获取数据集目录并接入内部数据平台
  • 研究者检索特定领域开放数据并确认访问方式与许可

替代项目

google-dataset-search、datahub、ckan

项目介绍

open-data-registry 是数据集领域的开源项目,由 awslabs 开发,2017 年首次发布。

在全站 12,822 个收录项目中,它的 GitHub 星标数(1,784)位列前 30%,在数据集分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。免费公开访问,数据集本身可能产生AWS费用。从国内网络环境看,可直接访问。

它主要面向的使用场景是:数据科学家快速查找可用的公开数据集用于建模。同类可对比的替代方案包括 google-dataset-search、datahub、ckan。

上一篇:giga-datasets

下一篇:datasets

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10496 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1643 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3395 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09