deepfabric

一条流水线搞定合成数据生成、训练与评估

deepfabric 是一个面向 AI 数据工程的一体化流水线工具,旨在解决高质量合成数据生成、模型训练、评估与蒸馏的割裂问题。它提供从数据生成到模型优化的完整闭环,支持通过 agents 或规则生成合成数据,并集成 Hugging Face datasets 生态,方便数据加载与导出。核心能力包括:合成数据生成(支持多种策略)、数据质量度量与过滤、模型微调(fine-tuning)与蒸馏(distillation),以及统一的评估框架。用户可以通过简洁的 Python API 或配置文件定义流水线,自动完成数据生成、清洗、训练和评估,显著降低构建高质量数据集的门槛。项目处于早期阶段,但架构清晰,适合需要快速迭代合成数据与模型优化的研究者和工程师。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 886
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类数据集
开发团队nolabs-ai
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型agents,ai,data-science,dataset,distillation,evaluation,fine-tuning,huggingface,huggingface-datasets,machine-learning,open,open-source,python,source,synthetic,synthetic-data,unsloth
GitHub 星标★ 886
30天Star增速
HF 下载量
上线时间2024-10-25 00:00:00
最近更新2026-09-09 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数8

使用教程

核心亮点

  • 集成数据生成、训练、评估全流程,减少工具切换成本
  • 基于 Hugging Face datasets,生态兼容性好,易于接入现有工作流
  • 支持蒸馏与微调,适合模型压缩和领域适配场景

不足之处

  • 文档/社区待观察
  • 早期项目,API 可能不稳定,需关注版本迭代

适用场景

  • 合成数据驱动的模型微调与蒸馏
  • 数据稀缺场景下的训练数据增强
  • 模型迭代中的自动化评估与质量监控

替代项目

Datagen、Mostly AI、Synthetic Data Vault (SDV)

项目介绍

deepfabric 是数据集领域的开源项目,由 nolabs-ai 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(886)位列前 30%,在数据集分类中处于中上游。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-09。Apache-2.0 许可证,可免费使用和部署。

它主要面向的使用场景是:合成数据驱动的模型微调与蒸馏。同类可对比的替代方案包括 Datagen、Mostly AI、Synthetic Data Vault (SDV)。

上一篇:Active-Learning-as-a-Service

下一篇:faker

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09