mega-data-factory 是数据集领域的开源项目,由 duoan 开发,是 2026 年新上线的项目。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 378。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-17。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:大规模多模态数据集的构建与清洗。同类可对比的替代方案包括 img2dataset、datatrove、DataComp。

打造高质量多模态数据集,让基础模型训练更高效
mega-data-factory 是一个面向大规模基础模型训练的多模态数据流水线框架,专注于解决数据质量与数据规模之间的平衡问题。它提供了一套从数据采集、清洗、去重、过滤到增强的完整工具链,支持图像、文本等多模态数据的处理。核心能力包括高效的数据去重算法、基于质量评估的筛选机制、以及可扩展的分布式处理架构,能够帮助AI团队构建高质量的训练数据集,从而提升模型性能。该项目强调数据为中心(data-centric AI)的理念,适用于预训练、微调等场景,尤其适合需要处理TB级以上数据的团队。
img2dataset、datatrove、DataComp
mega-data-factory 是数据集领域的开源项目,由 duoan 开发,是 2026 年新上线的项目。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 378。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-17。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:大规模多模态数据集的构建与清洗。同类可对比的替代方案包括 img2dataset、datatrove、DataComp。
上一篇:paper-list
下一篇:KG-MM-Survey
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models