dolma 是数据集领域的开源项目,由 allenai 开发,2023 年首次发布。
在全站 12,961 个收录项目中,它的 GitHub 星标数(1,545)位列前 30%,在数据集分类中处于中上游。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-15。Apache-2.0许可证,可免费使用和修改。
它主要面向的使用场景是:构建大规模预训练数据集。同类可对比的替代方案包括 RedPajama、Datasets (Hugging Face)、CCNet。

一键构建和质检大模型预训练数据,让数据可复现。
Dolma 是 AI2 团队为 OLMo 系列模型开发的数据工具包,专注于预训练数据的生成与质量检查。它解决的核心问题是:大模型预训练数据规模庞大、来源混杂,难以保证质量和可复现性。Dolma 提供了一套标准化的数据流水线,支持从原始文本清洗、去重、过滤到最终混合配比的完整流程,并内置了数据可视化与统计分析功能,帮助研究者理解数据分布、识别潜在偏差。其核心能力包括高效的流式处理、灵活的插件化设计,以及可追溯的数据版本管理,使得构建高质量预训练数据集变得系统化和可审计。
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
1克隆项目仓库
从 GitHub 获取 Dolma Toolkit 源码,后续请以仓库内 README 的安装说明为准。
git clone https://github.com/allenai/dolma.git2进入项目目录
切换到克隆下来的仓库目录,查看 README 与 docs 下的官方文档。
cd dolma3下载 Dolma 数据集
数据集托管在 HuggingFace Hub 的 allenai/dolma 页面,按该页面指引下载,注意磁盘与带宽。
4查阅官方文档
阅读官网文字说明与 data sheet,了解数据构成与流水线用法。
README 未给出验证方式;克隆后仓库内出现源码目录与 docs 文档即表示准备完成。
Q:如何获取 Dolma 数据集?
A:Dolma 数据集发布在 HuggingFace Hub:huggingface.co/datasets/allenai/dolma,从该页面下载。
Q:Dolma 使用什么许可证?
A:Dolma 数据集采用 ODC-BY 许可证,详见官方博客说明。
Q:Dolma 和 OLMo 是什么关系?
A:Dolma 是 AI2 为 OLMo 语言模型开发的预训练训练语料。
Q:哪里能看到更详细的说明?
A:可访问官网 allenai.github.io/dolma,以及仓库 docs/assets 下的 data sheet 文档。
RedPajama、Datasets (Hugging Face)、CCNet
dolma 是数据集领域的开源项目,由 allenai 开发,2023 年首次发布。
在全站 12,961 个收录项目中,它的 GitHub 星标数(1,545)位列前 30%,在数据集分类中处于中上游。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-15。Apache-2.0许可证,可免费使用和修改。
它主要面向的使用场景是:构建大规模预训练数据集。同类可对比的替代方案包括 RedPajama、Datasets (Hugging Face)、CCNet。
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models