dolma

一键构建和质检大模型预训练数据,让数据可复现。

Dolma 是 AI2 团队为 OLMo 系列模型开发的数据工具包,专注于预训练数据的生成与质量检查。它解决的核心问题是:大模型预训练数据规模庞大、来源混杂,难以保证质量和可复现性。Dolma 提供了一套标准化的数据流水线,支持从原始文本清洗、去重、过滤到最终混合配比的完整流程,并内置了数据可视化与统计分析功能,帮助研究者理解数据分布、识别潜在偏差。其核心能力包括高效的流式处理、灵活的插件化设计,以及可追溯的数据版本管理,使得构建高质量预训练数据集变得系统化和可审计。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1545
维护状态 维护中
是否开源
定价模式 free

项目数据

分类开源模型
开发团队allenai
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和修改。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型data-processing,large-language-models,llm,machile-learning,nlp
GitHub 星标★ 1545
30天Star增速
HF 下载量
上线时间2023-06-20 00:00:00
最近更新2026-09-23 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(项目为 Python 编写的工具包)
  • 可访问 GitHub 与 HuggingFace Hub 的网络
  • 充足磁盘空间(Dolma 数据集为 3 万亿 token 规模)

安装与启动步骤

  1. 1克隆项目仓库

    从 GitHub 获取 Dolma Toolkit 源码,后续请以仓库内 README 的安装说明为准。

    git clone https://github.com/allenai/dolma.git
  2. 2进入项目目录

    切换到克隆下来的仓库目录,查看 README 与 docs 下的官方文档。

    cd dolma
  3. 3下载 Dolma 数据集

    数据集托管在 HuggingFace Hub 的 allenai/dolma 页面,按该页面指引下载,注意磁盘与带宽。

  4. 4查阅官方文档

    阅读官网文字说明与 data sheet,了解数据构成与流水线用法。

如何确认成功

README 未给出验证方式;克隆后仓库内出现源码目录与 docs 文档即表示准备完成。

常见问题

Q:如何获取 Dolma 数据集?

A:Dolma 数据集发布在 HuggingFace Hub:huggingface.co/datasets/allenai/dolma,从该页面下载。

Q:Dolma 使用什么许可证?

A:Dolma 数据集采用 ODC-BY 许可证,详见官方博客说明。

Q:Dolma 和 OLMo 是什么关系?

A:Dolma 是 AI2 为 OLMo 语言模型开发的预训练训练语料。

Q:哪里能看到更详细的说明?

A:可访问官网 allenai.github.io/dolma,以及仓库 docs/assets 下的 data sheet 文档。

注意事项

  • 本次 README 节选未包含安装命令与依赖说明,实际安装步骤请以仓库最新 README 为准。
  • 网络信息中未提供 pip、conda 或 Docker 安装方式,请勿套用其他项目的命令。
  • 3 万亿 token 的数据集体积庞大,下载前请评估存储空间与网络带宽。

核心亮点

  • 提供从清洗、去重到混合的完整数据流水线,开箱即用
  • 内置数据可视化工具,直观呈现数据分布与质量
  • 与 OLMo 模型深度集成,数据可复现性强

不足之处

  • 文档偏学术化,上手门槛较高
  • 社区生态相对较小,问题响应可能较慢

适用场景

  • 构建大规模预训练数据集
  • 数据质量审计与去重
  • 研究数据配比对模型性能的影响

替代项目

RedPajama、Datasets (Hugging Face)、CCNet

项目介绍

dolma 是数据集领域的开源项目,由 allenai 开发,2023 年首次发布。

在全站 12,961 个收录项目中,它的 GitHub 星标数(1,545)位列前 30%,在数据集分类中处于中上游。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-15。Apache-2.0许可证,可免费使用和修改。

它主要面向的使用场景是:构建大规模预训练数据集。同类可对比的替代方案包括 RedPajama、Datasets (Hugging Face)、CCNet。

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09