curator

把杂乱合成数据变成高质量训练集,提升模型后训练效果。

curator 是一个专注于合成数据策展的开源工具,主要服务于大语言模型的后训练阶段和结构化数据提取。它解决了高质量训练数据难以获取、合成数据质量参差不齐的问题,提供了一套从数据生成、清洗、过滤到格式化的完整流程。核心能力包括:支持多种数据源接入,内置数据质量评估与去重机制,可灵活配置数据转换管道,并针对结构化数据提取场景进行了优化。项目基于 Python 实现,易于集成到现有的机器学习工作流中。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1734
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队bespokelabsai
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型agents,deep-learning,fine-tuning,instruction-tuning,llm,machine-learning,natural-language-processing,prompt,python,synthetic-data,synthetic-dataset-generation
GitHub 星标★ 1734
30天Star增速
HF 下载量
上线时间2024-10-28 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • 已安装 Python 与 pip(README 未指定具体版本)
  • 可访问 PyPI 的网络环境
  • 运行真实 Fireworks 微调需有训练配额的账号(Tier 2 / credits)
  • 没有 Fireworks SDK 或 API Key 时,可在 mock 模式下离线运行示例与测试

安装与启动步骤

  1. 1安装 curator

    README 给出的唯一安装命令,从 PyPI 安装官方包 bespokelabs-curator。建议在虚拟环境中执行。

    pip install bespokelabs-curator
  2. 2确认安装成功

    用 pip show 查看该包的信息,能显示版本号与安装位置即表示安装成功。

    pip show bespokelabs-curator
  3. 3准备 Fireworks 账号

    README 说明真实训练需要带训练配额的 Fireworks 账号(Tier 2 / credits);无 SDK 或 API Key 时训练器会进入 mock 模式。

  4. 4运行微调示例

    参考仓库 examples/fireworks/ 下的 basic 与 custom-trainer 示例,用 FireworksTrainer 上传数据并启动 SFT 训练。README 未给出示例具体文件名,请以仓库内实际文件为准。

  5. 5从检查点恢复训练

    结果对象提供 result.checkpoints(CheckpointInfo 列表),可加载最后一个检查点继续训练,避免重跑已完成的步数。

    trainer.load_checkpoint(result.checkpoints[-1])

如何确认成功

执行 pip show bespokelabs-curator 能看到版本号;或运行 examples/fireworks/ 示例后打印出 Fine-tuned model: 。

常见问题

Q:没有 Fireworks 账号或 API Key 能跑吗?

A:可以。README 说明在没有 SDK 或 API Key 时,FireworksTrainer 会以 mock 模式运行,方便示例和测试离线执行。

Q:运行真实训练有什么前置条件?

A:需要一个具备训练配额的 Fireworks 账号(Tier 2 或相应 credits),否则无法真正提交监督微调(SFT)任务。

Q:如何适配自己的数据格式?

A:继承 FireworksTrainer 并重写 format_example() 方法即可,做法与 TinkerTrainer 完全一致。

Q:训练中途中断怎么办?

A:从 result.checkpoints 取出 CheckpointInfo 列表,用 trainer.load_checkpoint(checkpoints[-1]) 加载最近检查点后继续训练。

注意事项

  • README 只提供了 pip 安装方式,未给出源码克隆、Docker 或云部署步骤。
  • Fireworks 部署是按需创建的无服务器部署,启动需要几分钟,完成后记得调用 trainer.close() 释放资源。
  • 训练完成后可从 result.weights_name 获取微调模型名称。
  • 示例代码与命令请以仓库 examples/fireworks/ 目录的实际内容为准。

核心亮点

  • 提供端到端的数据策展管道,从生成到清洗一步到位
  • 内置质量评估和去重机制,有效提升数据纯度
  • 针对结构化数据提取优化,适合特定任务场景

不足之处

  • 文档/社区待观察
  • 项目相对年轻,生态和案例积累有限

适用场景

  • 大模型后训练阶段的数据准备
  • 结构化信息抽取任务的数据构建
  • 合成数据质量过滤与格式化

替代项目

datasets、distilabel、argilla

项目介绍

curator 是数据集领域的开源项目,由 bespokelabsai 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,734)位列前 30%,在数据集分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0许可,可免费使用和部署。

它主要面向的使用场景是:大模型后训练阶段的数据准备。同类可对比的替代方案包括 datasets、distilabel、argilla。

上一篇:graph-fraud-detection-papers

下一篇:Curator

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09