mostlyai

用差分隐私生成安全可用的合成数据,解决数据获取难题

mostlyai 是一个用于生成合成数据的 Python SDK,旨在解决真实数据隐私泄露和获取受限的问题。它通过生成与原始数据统计特征相似但不包含真实个体信息的合成数据,支持表格数据、时间序列等类型。核心能力包括:基于差分隐私的强隐私保护、条件数据生成(可按指定条件生成数据)、多表关联数据生成,以及数据质量评估。该工具适用于数据共享、机器学习模型开发、软件测试等需要大量数据但受限于隐私法规的场景。它提供了简洁的 API 和配置化的生成流程,使得非专家也能快速上手。作为早期项目,其文档和生态仍在完善中,但核心功能已具备实用性。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 799
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队mostly-ai
所属国家
定价模式free
价格说明开源免费
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型differential-privacy,generative-ai,machine-learning,privacy-enhancing-technologies,synthetic-data,synthetic-data-generation,synthetic-data-generator
GitHub 星标★ 799
30天Star增速
HF 下载量
上线时间2023-12-22 00:00:00
最近更新2026-09-10 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-08
浏览次数2

使用教程

核心亮点

  • 内置差分隐私机制,从源头保护数据隐私,避免真实数据泄露风险
  • 支持条件生成和多表关联,能按业务场景定制合成数据,灵活度高
  • 提供数据质量评估工具,帮助用户验证合成数据与真实数据的相似度

不足之处

  • 文档和社区生态尚不完善,用户上手可能缺少参考案例
  • 生成复杂高维数据的性能和精度有待验证

适用场景

  • 在遵守 GDPR 等法规前提下,向第三方共享数据用于研究或合作
  • 扩充训练数据集,提升机器学习模型的泛化能力
  • 为开发测试环境生成模拟数据,避免使用生产环境敏感数据

替代项目

Synthetic Data Vault (SDV)、YData Synthetic、Gretel.ai

项目介绍

mostlyai 是数据集领域的开源项目,由 mostly-ai 开发,2023 年首次发布。

在全站 12,753 个收录项目中,它的 GitHub 星标数(799)位列前 30%,在数据集分类中处于中上游。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-10。开源免费。

它主要面向的使用场景是:在遵守GDPR等法规前提下,向第三方共享数据用于研究或合作。同类可对比的替代方案包括 Synthetic Data Vault (SDV)、YData Synthetic、Gretel.ai。

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10496 2026-08-10
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3395 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09
stopes 开源

一键准备多语言翻译数据,从清洗到挖掘平行语料

A library for preparing data for machine translation research (monolingual preproces···

★ 313 2026-08-10