datasets

伊利诺伊大学精选数据集,Notebook 即开即用做实验

datasets 是一个由伊利诺伊大学相关作者维护的公开数据集集合仓库,主要用 Jupyter Notebook 组织与展示,收录了多个来源有趣、主题各异的数据集,涵盖统计、机器学习、社会科学等方向。它解决的是研究者、学生和数据爱好者寻找可直接下载、可复现实验的小型数据集时,常常需要四处搜索、格式不统一、缺少说明文档的问题。核心能力包括:以 Notebook 形式提供数据加载与初步探索示例,让使用者能快速查看字段含义、数据规模和基本分布;数据集文件本身可直接下载用于建模、可视化或教学演示;仓库结构简单,便于按主题挑选所需数据。适合作为课程作业、算法原型验证、数据可视化练习的轻量数据来源,也适合想了解真实数据长什么样的初学者。整体定位偏教学与实验,而非生产级数据平台。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 194
维护状态 活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队wadefagen
所属国家
官网地址
定价模式free
价格说明开源免费数据集,无付费信息
访问状态
是否开源
开源协议
主要语言Jupyter Notebook
技术栈/模型
GitHub 星标★ 194
30天Star增速
HF 下载量
上线时间2018-03-25 00:00:00
最近更新2026-09-14 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-21
浏览次数0

使用教程

核心亮点

  • 用 Jupyter Notebook 组织,打开即可看到数据加载和初步探索代码,上手门槛低
  • 数据集主题多样,覆盖统计、机器学习、社会科学等,适合教学和原型验证
  • 仓库结构简单,数据文件可直接下载,不依赖复杂工具链

不足之处

  • 星标仅 194,社区活跃度和维护频率有限,部分数据可能长期未更新
  • 数据集规模偏小、来源集中在伊利诺伊大学,覆盖面和权威性不如大型公开数据平台

适用场景

  • 高校课程作业中快速获取可复现的小型数据集做统计分析
  • 机器学习初学者用真实数据练习数据清洗、可视化和建模流程
  • 数据可视化爱好者挑选有趣主题数据制作图表或演示

替代项目

awesome-public-datasets、Kaggle Datasets、UCI Machine Learning Repository

项目介绍

datasets 是数据集领域的开源项目,由 wadefagen 开发,2018 年首次发布。

它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 194。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-14。开源免费数据集,无付费信息。

它主要面向的使用场景是:高校课程作业中快速获取可复现的小型数据集做统计分析。同类可对比的替代方案包括 awesome-public-datasets、Kaggle Datasets、UCI Machine Learning Repository。

上一篇:open-data-registry

下一篇:GVINS-Dataset

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10496 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1643 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3395 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09