vega-datasets 是数据集领域的开源项目,由 vega 开发,2015 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 311。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。开源免费,无付费计划。
它主要面向的使用场景是:数据可视化教学或教程中快速加载示例数据演示图表。同类可对比的替代方案包括 seaborn-data、plotly-datasets。

一行代码加载经典示例数据,快速做可视化原型
vega-datasets 是 Vega 生态的公共示例数据集仓库,为 Vega、Vega-Lite、Altair 等可视化工具提供统一、稳定的测试与演示数据源。它解决了可视化项目各自维护示例数据、版本不一致、引用路径混乱的问题:所有数据集集中存放,通过简单命名即可在代码中引用,避免重复下载和格式转换。核心能力包括:提供数十个经典数据集(如 cars、stocks、gapminder、movies 等),覆盖数值、分类、时间序列等常见类型;统一以 JSON/CSV 等格式存储,并附带 Python 包接口,可直接通过 vega_datasets 库按名称加载为 DataFrame;支持本地缓存与远程 URL 两种访问方式,方便离线使用。项目是 Vega 官方组织下的基础组件,被大量教程、文档和测试用例引用,是学习数据可视化和快速搭建原型时的常用数据来源。
seaborn-data、plotly-datasets
vega-datasets 是数据集领域的开源项目,由 vega 开发,2015 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 311。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。开源免费,无付费计划。
它主要面向的使用场景是:数据可视化教学或教程中快速加载示例数据演示图表。同类可对比的替代方案包括 seaborn-data、plotly-datasets。
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models