synthetic-data-examples

跑通几个 Notebook,快速学会生成合成数据

synthetic-data-examples 是一个用 Jupyter Notebook 编写的合成数据生成示例合集,主要面向需要生成训练数据但受限于隐私、成本或数据稀缺的机器学习开发者。项目通过多个可运行的 notebook,演示如何用不同方法生成结构化、表格型或文本类合成数据,覆盖常见库和工具链,帮助用户快速理解合成数据的生成流程与效果评估。核心能力包括:展示多种生成策略(如基于统计分布、生成模型、规则模板等)的代码实现;提供可直接复用的示例代码,降低上手门槛;对比真实数据与合成数据的分布差异,辅助判断生成质量。它解决的是“知道合成数据有用但不知道从哪下手”的问题,适合作为入门参考和教学材料。项目体量较小,属于早期示例集合,不提供完整框架或生产级工具,更适合学习与原型验证。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 175
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队NVIDIA-Omniverse
所属国家
官网地址
定价模式free
价格说明开源免费,无在线服务
访问状态
是否开源
开源协议NOASSERTION
主要语言Jupyter Notebook
技术栈/模型
GitHub 星标★ 175
30天Star增速
HF 下载量
上线时间2023-03-07 00:00:00
最近更新2026-09-16 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-12
浏览次数0

使用教程

核心亮点

  • 用 Jupyter Notebook 呈现,代码、说明和输出在同一页面,边看边跑,学习成本低
  • 覆盖多种合成数据生成思路,不局限于单一库或方法,便于横向对比
  • 示例代码可直接复制到自己的项目中修改,适合快速原型验证

不足之处

  • 项目星标较少,社区活跃度和维护频率有限,长期更新不确定
  • 示例偏教学性质,缺少生产级封装、性能优化和完整评估指标

适用场景

  • 机器学习初学者想了解合成数据生成的基本流程和常用方法
  • 数据科学家在隐私敏感场景下需要快速生成替代数据做实验
  • 教师或培训者寻找可演示的合成数据教学案例

替代项目

sdv、ydata-synthetic、faker

项目介绍

synthetic-data-examples 是一个数据集领域的开源项目,官方简介:Synthetic Data Generation Examples。项目使用 Jupyter Notebook 开发,在 GitHub 上获得 172 星标。

上一篇:synthetic-data-showcase

下一篇:sdg_hub

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10456 2026-08-10
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3394 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09
stopes 开源

一键准备多语言翻译数据,从清洗到挖掘平行语料

A library for preparing data for machine translation research (monolingual preproces···

★ 313 2026-08-10