synthetic-data-showcase

生成假数据保真又护隐私,还能直接看界面

synthetic-data-showcase 是一个用 Rust 编写的开源示例项目,聚焦于生成合成数据与配套用户界面,帮助在保护隐私的前提下完成数据共享与分析。它解决的核心问题是:真实数据往往包含个人身份、医疗、金融等敏感信息,直接共享会带来合规与泄露风险,而简单脱敏又可能破坏数据的统计特征。项目通过合成数据生成技术,产出结构与分布接近原始数据但不含真实个体的替代数据集,并附带可交互的界面,让数据分析师、研究人员和开发者能够直观地查看、比较和验证合成效果。核心能力包括合成数据生成流程演示、隐私保护导向的数据共享思路,以及面向分析场景的 UI 示例。项目定位偏向教学与原型验证,适合作为理解合成数据与隐私计算落地方式的入门参考。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 126
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队microsoft
所属国家
官网地址
定价模式free
价格说明开源项目,免费使用
访问状态
是否开源
开源协议MIT
主要语言Rust
技术栈/模型
GitHub 星标★ 126
30天Star增速
HF 下载量
上线时间2020-09-10 00:00:00
最近更新2026-09-04 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-12
浏览次数0

使用教程

核心亮点

  • 用 Rust 实现,性能与内存安全有保障,适合处理较大规模数据生成任务
  • 同时提供合成数据生成与用户界面,覆盖从数据到展示的完整链路,便于快速验证想法
  • 聚焦隐私保护场景,契合数据合规与共享的现实需求,方向明确

不足之处

  • 项目处于早期阶段,星标仅 126,生态与社区积累有限
  • 以 showcase 演示为主,通用性与生产级能力可能不足,缺少大规模落地验证

适用场景

  • 医疗或金融团队在共享数据前生成合成样本用于内部测试
  • 研究人员演示隐私保护数据发布流程与合成数据质量评估
  • 开发者学习 Rust 下合成数据生成与配套 UI 的实现思路

替代项目

SDV、ydata-synthetic

项目介绍

synthetic-data-showcase 是一个数据集领域的开源项目,官方简介:Generates synthetic data and user interfaces for privacy-preserving data sharing and analysis.。项目使用 Rust 开发,在 GitHub 上获得 126 星标。

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10496 2026-08-10
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3395 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09
stopes 开源

一键准备多语言翻译数据,从清洗到挖掘平行语料

A library for preparing data for machine translation research (monolingual preproces···

★ 313 2026-08-10