DataGen 是数据集领域的开源项目,由 HowieHwong 开发,2024 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 69。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-07-07。可自行部署使用,完全免费。
它主要面向的使用场景是:为垂直领域模型微调生成训练样本。同类可对比的替代方案包括 DataDreamer、Self-Instruct、LangChain Data Generator。

用大模型一键生成定制化训练数据,告别数据荒
DataGen 是一个基于大型语言模型(LLM)的统一合成数据集生成框架,相关论文已被 ICLR 2025 接收。它旨在解决真实数据获取成本高、隐私受限以及特定场景数据稀缺的问题,通过 LLM 自动生成高质量、多样化的合成数据,以支持下游模型训练、评估和微调。其核心能力包括:支持多种数据模态和任务类型的统一生成流程,提供可配置的生成策略以控制数据分布和难度,并集成数据过滤与质量评估机制,确保生成数据的可用性。项目目前处于早期阶段,代码库以 Python 为主,提供了简洁的 API 接口和示例脚本,便于研究者快速上手。
DataDreamer、Self-Instruct、LangChain Data Generator
DataGen 是数据集领域的开源项目,由 HowieHwong 开发,2024 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 69。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-07-07。可自行部署使用,完全免费。
它主要面向的使用场景是:为垂直领域模型微调生成训练样本。同类可对比的替代方案包括 DataDreamer、Self-Instruct、LangChain Data Generator。
上一篇:MathPile
下一篇:LLM-PuzzleTest
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models