synthetic-data-generator

一键生成高仿真表格数据,解决隐私与数据稀缺难题

synthetic-data-generator(SDG)是一个专门用于生成高质量结构化表格数据的开源框架。它解决的核心问题是真实数据获取难、隐私保护要求高、以及数据样本不足等场景下的数据需求。SDG 提供了一套完整的端到端流程,包括数据接入、数据探索、数据预处理、数据合成、数据评估和数据导出。它支持多种生成算法,如 GAN、VAE、扩散模型等,并针对不同数据类型(数值、类别、文本、时间序列)进行了优化。用户可以通过简单的配置或编程接口,快速生成与原始数据统计特征相似、且不泄露隐私的合成数据。该框架还内置了数据质量评估模块,能自动对比合成数据与真实数据的分布、相关性等指标,帮助用户验证生成效果。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2440
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队hitsz-ids
所属国家
官网地址
定价模式free
价格说明开源框架,Apache-2.0许可,完全免费,可自行部署使用。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型agent,data-generator,deep-learning,gan,generative-ai,llm,machine-learning,privacy,synthetic-data,tabular-data
GitHub 星标★ 2440
30天Star增速
HF 下载量
上线时间2023-08-10 00:00:00
最近更新2026-09-21 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

环境要求

  • Python 环境(README 未标明具体版本)
  • 已安装可用的 pip 包管理工具
  • 本地源码安装需已配置 git 及 GitHub SSH 访问

安装与启动步骤

  1. 1通过 PyPI 安装

    最简方式,直接从 PyPI 拉取并安装 sdgx 包,适合只想快速调用的用户。

    pip install sdgx
  2. 2克隆源码仓库

    README 推荐用源码方式使用 SDG,先用 SSH 地址把仓库克隆到本地。

    git clone git@github.com:hitsz-ids/synthetic-data-generator.git
  3. 3进入目录并安装

    切换到克隆下来的项目目录,执行本地安装,把当前源码装进环境。

    cd synthetic-data-generator
    pip install .
  4. 4备选:从 Git 直接安装

    若不想手动克隆,可用 pip 直接从 Git 仓库地址安装,等价于源码安装。

    pip install git+https://github.com/hitsz-ids/synthetic-data-generator.git

如何确认成功

README 未给出验证方式;可执行 python -c "import sdgx" 检查是否导入成功(此为推断,非 README 原文)。

常见问题

Q:安装方式该怎么选?

A:README 明确推荐 Local Install(源码安装),即克隆仓库后执行 pip install .;只想快速试用可直接 pip install sdgx。

Q:git clone 提示权限失败怎么办?

A:README 给的是 SSH 地址 git@github.com:...,需先配置好 GitHub SSH 密钥;也可改用 pip install git+https:// 的 HTTPS 方式。

Q:装完就能直接生成数据吗?

A:README 节选只覆盖安装部分,未提供使用与配置说明,需查阅官方文档站 synthetic-data-generator.readthedocs.io 再继续。

注意事项

  • README 未给出版本要求,如遇依赖冲突建议使用独立虚拟环境安装。
  • README 未提供任何配置项、端口或密钥说明,不要自行填入参数。
  • 三种安装方式选其一即可,PyPI 与源码安装不要在同一环境反复叠加。

核心亮点

  • 内置多种生成模型(GAN/VAE/扩散模型),覆盖不同数据类型的合成需求
  • 提供从数据接入到评估的完整流水线,开箱即用,降低使用门槛
  • 支持隐私保护(差分隐私),适合敏感数据场景

不足之处

  • 大规模数据生成时性能可能成为瓶颈
  • 文档/社区待观察

适用场景

  • 企业内部分析师需要扩充数据集进行建模测试
  • 医疗、金融等隐私敏感行业共享数据前进行脱敏合成
  • 机器学习竞赛或研究中需要构造对抗样本或数据增强

替代项目

SDV (Synthetic Data Vault)、CTGAN、Gretel Synthetics

项目介绍

synthetic-data-generator 是数据集领域的开源项目,由 hitsz-ids 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,440)位列前 30%,在数据集分类的 279 个项目里位列前 14%。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-21。Apache-2.0许可,完全免费,可自行部署使用。

它主要面向的使用场景是:企业内部分析师需要扩充数据集进行建模测试。同类可对比的替代方案包括 SDV (Synthetic Data Vault)、CTGAN、Gretel Synthetics。

上一篇:jailbreak_llms

下一篇:autolabel

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09