Curator

让 LLM 训练数据又快又干净,一键搞定预处理

Curator 是一个面向大型语言模型(LLM)的可扩展数据预处理与清洗工具包。它旨在解决 LLM 训练和微调中数据质量参差不齐、处理流程繁琐低效的问题。Curator 提供了一套模块化的数据处理流水线,支持数据去重、过滤、格式化、质量评估等常见操作,并针对大规模数据集进行了性能优化,能够并行处理海量数据。其核心能力包括灵活的数据源接入、可定制的处理规则、以及高效的分布式执行引擎,帮助开发者快速构建高质量的训练数据集,从而提升模型训练效果。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1779
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队NVIDIA-NeMo
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型data,data-curation,data-prep,data-preparation,data-processing,data-processing-pipelines,data-quality,datacuration,datarecipes,deduplication,fast-data-processing,fine-tuning,large-language-models,large-scale-data-processing,llm,llm-data-quality,llmapps,python,semantic-deduplication
GitHub 星标★ 1779
30天Star增速
HF 下载量
上线时间2024-03-14 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数12

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 环境(具体支持版本见项目根目录 pyproject.toml 或 PyPI 页面徽章)
  • uv 包管理器(官方指定用它来做安装)
  • 若处理视频/音频数据,需具备系统编解码库,或改用官方 Docker 容器
  • GPU 相关流水线需 NVIDIA GPU 环境(README 将 CPU、GPU、Docker、源码列为不同的安装路径)

安装与启动步骤

  1. 1安装 uv 包管理器

    NeMo Curator 官方指定使用 uv 进行安装,README 要求先装好它再走后续流程。命令会从 astral.sh 下载并安装 uv。

    curl -LsSf https://astral.sh/uv/install.sh | sh
  2. 2核对版本要求

    支持的 Python 版本与依赖版本统一写在 pyproject.toml 中,README 不再重复罗列,Python 版本也可从 PyPI 徽章查看,安装前先确认本机版本匹配。

  3. 3按硬件选择安装路径

    README 把安装分为 CPU、GPU、Docker、源码等路径,并指向官方 Installation Guide。请按自己的硬件条件打开对应章节照做,不要混用。

  4. 4音视频场景走容器

    视频和音频流水线依赖系统编解码库,官方发布的 NGC 容器已预配置好这些依赖,官方建议这类场景直接用容器运行。

  5. 5集群环境部署

    如需在 Slurm、Kubernetes 或多节点集群上运行,README 指向 Infrastructure 文档,其中给出了这些基础设施的部署参考。

如何确认成功

按官方 Installation Guide 完成对应路径的安装后,在 Python 中导入 nemo_curator 包不报错即表示安装成功。

常见问题

Q:我该选哪条安装路径(CPU / GPU / Docker / 源码)?

A:

Q:为什么视频和音频要推荐用 Docker?

A:

Q:支持哪些 Python 版本?

A:

Q:能在多机或集群上跑同一个流水线吗?

A:

注意事项

  • README 只给出了 uv 的安装命令,pip 安装命令、端口、路径等细节均未给出,请以官方 Installation Guide 为准。
  • 同一套流水线既可在单机笔记本运行,也可扩展到多节点 Ray 集群,按数据规模选择部署方式。
  • 镜像地址为 NGC 上的 nemo-curator 容器,音视频处理建议优先使用它。
  • 项目属于 NVIDIA NeMo 软件套件,API 参考与概念说明在官方文档站点单独维护。

核心亮点

  • 专为 LLM 数据设计,内置去重、过滤、质量打分等实用算子
  • 基于 Ray 等分布式框架,可水平扩展处理 TB 级数据
  • 提供简洁的 Python API,易于集成到现有训练流水线

不足之处

  • 项目较新,生态和文档尚不完善
  • 高级功能依赖 Ray 等外部组件,部署有一定复杂度

适用场景

  • 构建大规模预训练语料库前的数据清洗
  • 微调任务中筛选高质量指令数据
  • 持续更新训练数据时的自动化预处理

替代项目

datatrove、llm-data-curator、data-compressor

项目介绍

Curator 是数据集领域的开源项目,由 NVIDIA-NeMo 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,779)位列前 30%,在数据集分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,713 增加到 1,779,净增 66。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:构建大规模预训练语料库前的数据清洗。同类可对比的替代方案包括 datatrove、llm-data-curator、data-compressor。

上一篇:curator

下一篇:synthetic-data-kit

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09