DPSDA

不训练模型,也能生成高质量差分隐私合成数据

DPSDA 是一个专注于差分隐私(DP)合成数据生成的开源项目,核心思想是“私有进化”(Private Evolution),旨在在不训练生成模型(如 GAN 或扩散模型)的前提下,从真实数据集中生成具有差分隐私保证的合成数据。它解决了传统 DP 合成数据方法依赖复杂模型训练、计算成本高且隐私预算消耗大的问题。项目提供了多种算法实现,包括 ICML 2026、ICLR 2024 和 ICML 2024 Spotlight 论文中的方法,支持通过迭代进化、选择性采样和隐私聚合来生成高保真度的合成数据,同时保证严格的 DP 隐私边界。核心能力包括:无需模型训练、支持多种数据模态(图像、表格等)、提供隐私预算控制、以及易于集成的 Python API。该项目适合需要发布敏感数据集但又要保护个体隐私的研究者和工程师。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 117
维护状态 维护中
是否开源
定价模式 free

项目数据

分类开源模型
开发团队microsoft
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型differential-privacy,foundation-models,private-evolution,synthetic-data,training-free
GitHub 星标★ 117
30天Star增速
HF 下载量
上线时间2023-05-18 00:00:00
最近更新2026-09-04 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

核心亮点

  • 无需训练生成模型,大幅降低计算资源需求,适合资源受限场景
  • 提供多种论文级算法实现,覆盖不同隐私预算和数据分布
  • 隐私保护严格,支持可调节的差分隐私预算,便于实际部署

不足之处

  • 项目仍处于早期阶段,文档和社区支持尚待完善
  • 合成数据的质量可能受数据维度影响,高维数据下效率待验证

适用场景

  • 发布医疗或金融数据集时,生成隐私保护的合成副本供研究使用
  • 数据稀缺场景下,通过合成数据扩充训练集而不泄露原始隐私
  • 需要快速生成 DP 合成数据的原型验证或教学演示

替代项目

opendp、diffprivlib、SmartNoise

项目介绍

DPSDA 是数据集领域的开源项目,由 microsoft 开发,2023 年首次发布。

它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 117。

项目仍在小幅维护中,最近一次代码更新于 2026-09-04。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:发布医疗或金融数据集时,生成隐私保护的合成副本供研究使用。同类可对比的替代方案包括 opendp、diffprivlib、SmartNoise。

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09