
sdg_hub
用流水线批量造 LLM 训练数据,省去手写脚本
sdg_hub 是一个面向大语言模型的合成数据生成工具包,目标是帮助开发者低成本、可复现地构造高质量训练与微调数据集。它把合成数据流程拆解为可组合的模块,覆盖种子数据准备、提示模板管理、批量调用模型生成、结果清洗与去重、质量过滤等环节,并可与模型定制、AI Agent 工作流配合使用。相比自己写脚本拼接,它提供了更统一的配置方式和流水线抽象,方便把同一套生成逻辑迁移到不同模型或不同领域任务上。项目用 Python 实现,适合需要为指令微调、领域适配或评测集扩充准备数据的团队,尤其适合在数据稀缺或隐私受限、无法直接使用真实语料的场景下快速搭建合成数据管线。目前星标数不高,属于早期项目,接口和文档仍在演进中。
项目数据
使用教程
核心亮点
- 把合成数据流程模块化,提示模板、生成、清洗、过滤可组合复用
- 面向 LLM 微调与模型定制场景,与 ai-agents 工作流衔接自然
- Python 实现,便于二次开发和接入自有模型或推理服务
不足之处
- 项目处于早期,API 与文档可能频繁变动
- 社区规模小,示例和最佳实践积累有限
适用场景
- 为指令微调模型批量生成领域问答对
- 在真实数据受限时构造评测集或冷启动语料
- 结合 Agent 流水线自动扩充和清洗训练数据
替代项目
distilabel、DataDreamer、self-instruct
项目介绍
下一篇:GraphGen
同类项目推荐
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models
stopes
开源
一键准备多语言翻译数据,从清洗到挖掘平行语料
A library for preparing data for machine translation research (monolingual preproces···