SDV

把真实表格数据变成安全逼真的假数据,随便用不泄露隐私

SDV(Synthetic Data Vault)是一个用于表格数据合成生成的Python库,旨在解决真实数据隐私保护、数据稀缺和测试数据获取难的问题。它提供了一套完整的端到端流程,包括数据建模、采样生成和评估。核心能力基于深度学习模型(如GAN、变分自编码器等),能够学习原始表格数据的统计特征和相关性,从而生成高度逼真的合成数据。SDV支持多种数据类型(数值、类别、日期等),并内置了数据质量评估工具,可量化合成数据与真实数据的相似度及隐私风险。它特别适合在无法直接使用真实数据的场景下,生成可用于开发、测试和共享的替代数据,同时保持数据的统计效用。项目活跃,文档完善,是开源社区中表格数据合成领域的代表性工具。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3564
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类数据集
开发团队sdv-dev
所属国家
定价模式free
价格说明开源库,本地部署,完全免费。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型data-generation,deep-learning,gan,gans,generative-adversarial-network,generative-ai,generative-model,generativeai,machine-learning,multi-table,relational-datasets,sdv,synthetic-data,synthetic-data-generation,time-series
GitHub 星标★ 3564
30天Star增速
HF 下载量
上线时间2018-05-11 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数7

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

环境要求

  • Python 运行环境(SDV 是 Python 库)
  • pip 或 conda 包管理器(二选一)
  • 推荐使用虚拟环境(README 建议)
  • 可访问 PyPI 或 conda 频道以安装依赖

安装与启动步骤

  1. 1准备Python环境

    SDV 是 Python 库,README 推荐使用虚拟环境以避免与其他软件冲突。请先准备好 Python 与 pip/conda。

  2. 2pip安装SDV

    使用 pip 从 PyPI 安装 SDV 库。在已激活的虚拟环境或目标环境中执行。

    pip install sdv
  3. 3或用conda安装

    若使用 conda,可通过 pytorch 和 conda-forge 频道安装 SDV。与 pip 方式二选一即可。

    conda install -c pytorch -c conda-forge sdv
  4. 4加载示例数据集

    使用 SDV 内置的 download_demo 加载单表示例数据集 fake_hotel_guests,验证安装是否成功。

    python -c "from sdv.datasets.demo import download_demo; real_data, metadata = download_demo(modality='single_table', dataset_name='fake_hotel_guests'); print(real_data.head())"

如何确认成功

执行加载示例数据的命令后,成功输出 real_data 的前几行即表示安装成功。

常见问题

Q:pip 和 conda 安装方式如何选择?

A:README 提供两种方式,pip install sdv 或 conda install -c pytorch -c conda-forge sdv,任选其一即可。

Q:如何快速加载示例数据?

A:运行 from sdv.datasets.demo import download_demo; download_demo(modality='single_table', dataset_name='fake_hotel_guests') 即可下载演示数据。

Q:SDV 支持哪些模型?

A:README 提到从经典统计方法 GaussianCopula 到深度学习方法 CTGAN,支持单表、多表和序列数据。

Q:安装 SDV 需要付费吗?

A:SDV 在 Business Source License 下公开提供,具体使用条款请查看仓库 LICENSE 文件。

注意事项

  • README 推荐使用虚拟环境,避免与其他软件冲突。
  • conda 安装需指定 -c pytorch -c conda-forge 频道。
  • 示例数据集 fake_hotel_guests 为单表数据,包含 guest_email 主键。

核心亮点

  • 支持多种表格数据类型和复杂关系,建模能力强
  • 内置评估模块,能量化合成数据的质量与隐私风险
  • API设计简洁,几行代码即可完成模型训练和采样生成

不足之处

  • 深度学习模型训练耗时较长,对硬件有要求
  • 复杂约束(如业务规则)的保持能力有限,需额外处理

适用场景

  • 在开发测试环境中生成不含真实用户信息的模拟数据
  • 向外部合作伙伴或公众分享数据时,用合成数据保护隐私
  • 扩充小样本数据集,提升下游机器学习模型的泛化能力

替代项目

CTGAN、YData Synthetic、Gretel Synthetics

项目介绍

SDV 是数据集领域的开源项目,由 sdv-dev 开发,2018 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,564)位列前 30%,在数据集分类的 279 个项目里位列前 9%。

近 42 天,它的 GitHub 星标从 3,543 增加到 3,564,净增 21。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。开源库,本地部署,完全免费。

它主要面向的使用场景是:在开发测试环境中生成不含真实用户信息的模拟数据。同类可对比的替代方案包括 CTGAN、YData Synthetic、Gretel Synthetics。

上一篇:mimesis

下一篇:distilabel

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09