vega-datasets

一行代码加载经典示例数据,快速做可视化原型

vega-datasets 是 Vega 生态的公共示例数据集仓库,为 Vega、Vega-Lite、Altair 等可视化工具提供统一、稳定的测试与演示数据源。它解决了可视化项目各自维护示例数据、版本不一致、引用路径混乱的问题:所有数据集集中存放,通过简单命名即可在代码中引用,避免重复下载和格式转换。核心能力包括:提供数十个经典数据集(如 cars、stocks、gapminder、movies 等),覆盖数值、分类、时间序列等常见类型;统一以 JSON/CSV 等格式存储,并附带 Python 包接口,可直接通过 vega_datasets 库按名称加载为 DataFrame;支持本地缓存与远程 URL 两种访问方式,方便离线使用。项目是 Vega 官方组织下的基础组件,被大量教程、文档和测试用例引用,是学习数据可视化和快速搭建原型时的常用数据来源。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 311
维护状态 活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队vega
所属国家
官网地址
定价模式free
价格说明开源免费,无付费计划
访问状态
是否开源
开源协议
主要语言Python
技术栈/模型datasets
GitHub 星标★ 311
30天Star增速
HF 下载量
上线时间2015-10-08 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-21
浏览次数0

使用教程

核心亮点

  • 数据集经过统一清洗和格式规范,可直接用于 Vega/Vega-Lite/Altair 示例,省去预处理
  • 提供 Python 包接口,通过名称即可加载为 DataFrame,支持本地缓存,离线也能用
  • 被官方文档和大量教程引用,数据名称稳定,适合教学和测试用例复用

不足之处

  • 数据集数量和更新频率有限,仅覆盖经典示例场景,不适合真实业务数据需求
  • 仓库本身以数据文件为主,缺乏详细的数据字典和字段说明文档

适用场景

  • 数据可视化教学或教程中快速加载示例数据演示图表
  • Altair/Vega-Lite 项目开发时用统一数据集做单元测试和回归验证
  • 数据分析原型阶段需要现成、干净的小型数据集快速验证想法

替代项目

seaborn-data、plotly-datasets

项目介绍

vega-datasets 是数据集领域的开源项目,由 vega 开发,2015 年首次发布。

它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 311。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。开源免费,无付费计划。

它主要面向的使用场景是:数据可视化教学或教程中快速加载示例数据演示图表。同类可对比的替代方案包括 seaborn-data、plotly-datasets。

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10496 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1643 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3395 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09