dataset-viewer 是数据集领域的开源项目,由 huggingface 开发,2021 年首次发布。
在全站 12,822 个收录项目中,它的 GitHub 星标数(900)位列前 30%,在数据集分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-20。开源免费,作为Hugging Face平台基础设施提供。
它主要面向的使用场景是:在HuggingFace数据集页面实现样本在线预览。同类可对比的替代方案包括 datasette、streamlit。

不下载数据集,网页直接看样本和统计
dataset-viewer 是 Hugging Face 官方开源的后端服务,为数据集页面上的在线预览功能提供公共 API。它解决的核心问题是:用户无需下载动辄数 GB 的数据集,就能直接在网页上查看数据集的字段结构、样本内容、分片信息和统计分布。核心能力包括:读取 Hugging Face Hub 上的数据集文件,自动解析 Parquet、CSV、JSON 等格式,生成分页预览接口;提供 /rows、/first-rows、/size、/statistics 等 REST 端点;支持数据集配置和分片选择;内置缓存与并发控制,支撑高流量访问。项目用 Python 编写,可独立部署,也可作为其他数据平台构建数据集预览功能的参考实现。
datasette、streamlit
dataset-viewer 是数据集领域的开源项目,由 huggingface 开发,2021 年首次发布。
在全站 12,822 个收录项目中,它的 GitHub 星标数(900)位列前 30%,在数据集分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-20。开源免费,作为Hugging Face平台基础设施提供。
它主要面向的使用场景是:在HuggingFace数据集页面实现样本在线预览。同类可对比的替代方案包括 datasette、streamlit。
上一篇:vega-datasets
下一篇:datasets
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models