datumaro 是数据集领域的开源项目,由 open-edge-platform 开发,2020 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 690。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,无付费版本。
它主要面向的使用场景是:数据准备阶段批量转换标注格式。同类可对比的替代方案包括 FiftyOne、SuperAnnotate、Label Studio。

一个工具搞定 CV 数据集格式转换与质量检查
datumaro 是一个面向计算机视觉的数据集管理框架,提供 Python 库和命令行工具,用于构建、分析和维护 CV 数据集。它解决的核心问题是深度学习项目中数据集格式混乱、转换繁琐、质量难以把控的痛点。核心能力包括:支持 COCO、Pascal VOC、YOLO、ImageNet 等多种主流标注格式的导入导出与互转;提供数据集统计分析、标签分布查看、错误样本筛选等质量检查功能;支持数据集合并、拆分、过滤、重命名等操作,方便构建训练/验证集;还提供插件机制,可扩展自定义格式和操作。通过统一的 API 和 CLI,用户能高效管理多源数据集,减少重复劳动,提升数据准备阶段的效率。
FiftyOne、SuperAnnotate、Label Studio
datumaro 是数据集领域的开源项目,由 open-edge-platform 开发,2020 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 690。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,无付费版本。
它主要面向的使用场景是:数据准备阶段批量转换标注格式。同类可对比的替代方案包括 FiftyOne、SuperAnnotate、Label Studio。
下一篇:mimesis
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models