DataGen

用大模型一键生成定制化训练数据,告别数据荒

DataGen 是一个基于大型语言模型(LLM)的统一合成数据集生成框架,相关论文已被 ICLR 2025 接收。它旨在解决真实数据获取成本高、隐私受限以及特定场景数据稀缺的问题,通过 LLM 自动生成高质量、多样化的合成数据,以支持下游模型训练、评估和微调。其核心能力包括:支持多种数据模态和任务类型的统一生成流程,提供可配置的生成策略以控制数据分布和难度,并集成数据过滤与质量评估机制,确保生成数据的可用性。项目目前处于早期阶段,代码库以 Python 为主,提供了简洁的 API 接口和示例脚本,便于研究者快速上手。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 69
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队HowieHwong
所属国家
定价模式free
价格说明开源项目,可自行部署使用,完全免费。
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型benchmark,dataset,dataset-generation,large-language-models,llm,synthetic-data,toolkit
GitHub 星标★ 69
30天Star增速
HF 下载量
上线时间2024-05-26 00:00:00
最近更新2026-07-07 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数15

使用教程

核心亮点

  • 统一框架覆盖分类、生成、问答等多任务,减少重复开发
  • 基于 ICLR 论文,生成策略有理论支撑,质量有保障
  • 提供可配置参数,能按需调整数据难度和多样性

不足之处

  • 文档/社区待观察
  • 项目处于早期,API 和功能可能不够稳定

适用场景

  • 为垂直领域模型微调生成训练样本
  • 在隐私敏感场景下替代真实数据用于评估
  • 快速扩充小样本数据集以提升模型泛化能力

替代项目

DataDreamer、Self-Instruct、LangChain Data Generator

项目介绍

DataGen 是数据集领域的开源项目,由 HowieHwong 开发,2024 年首次发布。

它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 69。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-07-07。可自行部署使用,完全免费。

它主要面向的使用场景是:为垂直领域模型微调生成训练样本。同类可对比的替代方案包括 DataDreamer、Self-Instruct、LangChain Data Generator。

上一篇:MathPile

下一篇:LLM-PuzzleTest

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1647 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09