synthetic-data
本站收录 46 个带「synthetic-data」标签的 AI 开源项目
machine-learning-for-trading这是一个与《Machine Learning for Trading》第三版配套的开源代码仓库,旨在帮助读者和开发者系统学习如何将机器学习技术应用于金融交易。项★ 21,121
data-juicerData-Juicer 是一个面向大模型的数据处理与分析工具,旨在解决模型训练数据质量参差不齐、处理流程繁琐低效的问题。它提供了一套系统化的数据加工流水线,包含★ 7,105
KilnKiln 是一个面向 AI 系统的全流程开发平台,旨在解决从数据准备到模型优化过程中工具链割裂、协作困难的问题。它提供数据集管理、人工标注与协作、评估(eval★ 5,130
mimesisMimesis 是一个 Python 库,用于生成逼真的假数据,支持多种语言和地区(locale)。它解决了开发、测试和演示阶段需要大量真实感测试数据的问题,无★ 4,840
SDVSDV(Synthetic Data Vault)是一个用于表格数据合成生成的Python库,旨在解决真实数据隐私保护、数据稀缺和测试数据获取难的问题。它提供了★ 3,567
distilabelDistilabel 是一个面向工程师的合成数据与 AI 反馈框架,旨在帮助用户快速构建可靠、可扩展的数据流水线。它基于经过验证的研究论文,将复杂的合成数据生成★ 3,401
syntheaSynthea 是一个开源的合成患者群体模拟器,用 Java 编写,能够生成大规模、真实感强的合成电子健康记录(EHR)数据。它解决了医疗数据隐私与可用性之间的★ 3,366
pgmpypgmpy 是一个纯 Python 实现的概率图模型工具包,专注于因果推理与概率推理。它解决了从数据中学习贝叶斯网络结构、参数估计、因果效应识别与推断等问题。核★ 3,344
synthetic-data-generatorsynthetic-data-generator(SDG)是一个专门用于生成高质量结构化表格数据的开源框架。它解决的核心问题是真实数据获取难、隐私保护要求高、以★ 2,439
DataDesignerDataDesigner 是 NVIDIA 开源的合成数据生成工具,基于 NeMo 框架构建。它解决的是高质量训练数据获取难、成本高的问题,允许用户从零开始或基★ 2,293
unrealcvUnrealCV 是一个将计算机视觉与虚幻引擎(UE4/UE5)连接起来的开源工具,旨在为视觉研究提供高保真的虚拟世界数据生成平台。它解决了真实数据采集成本高、★ 2,218
greenmaskGreenmask 是一个用 Go 编写的数据库匿名化与测试数据管理工具,主要面向 PostgreSQL 和 MySQL。它解决了开发、测试环境中使用真实数据带★ 1,772
curatorcurator 是一个专注于合成数据策展的开源工具,主要服务于大语言模型的后训练阶段和结构化数据提取。它解决了高质量训练数据难以获取、合成数据质量参差不齐的问题★ 1,736
fg-data-syntheticfg-data-synthetic 是一个专注于表格数据和时间序列数据合成的开源工具库。它利用生成对抗网络(GAN)等深度学习技术,解决真实数据获取成本高、隐私★ 1,659
aisheetsaisheets 是一个基于 TypeScript 的开源工具,让用户无需编写代码即可用 AI 模型构建、丰富和转换数据集。它把表格界面与 LLM 能力结合,用★ 1,647
CTGANCTGAN 是一个基于条件生成对抗网络(Conditional GAN)的合成表格数据生成工具。它解决真实表格数据隐私保护、数据不平衡、样本不足等问题,通过深度★ 1,571
synthadocSynthadoc 是一个开源的 LLM 知识编译引擎,旨在将原始文档转化为结构化的本地优先 Wiki。它解决了传统 RAG 系统在可解释性和可维护性上的痛点,★ 1,496
intellagentIntellAgent 是一个面向智能体(Agent)的全面诊断与优化框架。它通过模拟真实场景下的合成交互数据,帮助开发者系统性地评估和调优基于大语言模型的智能★ 1,259
DataDreamerDataDreamer 是一个专注于合成数据生成与模型训练对齐的开源 Python 库。它解决的核心问题是:在真实数据稀缺或受隐私限制时,如何通过提示词(Pro★ 1,121
deepfabricdeepfabric 是一个面向 AI 数据工程的一体化流水线工具,旨在解决高质量合成数据生成、模型训练、评估与蒸馏的割裂问题。它提供从数据生成到模型优化的完整★ 886
verbalized-samplingVerbalized Sampling 是一个无需训练的提示词策略框架,旨在通过让大语言模型以概率形式输出候选答案,来缓解生成文本的模式坍缩问题。它解决的是 L★ 813
mammaMAMMA 是一个面向多人体运动捕捉的开源项目,主打无标记(markerless)且高精度的多人运动获取。它解决了传统光学动捕系统依赖昂贵标记点和专业设备、难以★ 813
mostlyaimostlyai 是一个用于生成合成数据的 Python SDK,旨在解决真实数据隐私泄露和获取受限的问题。它通过生成与原始数据统计特征相似但不包含真实个体信息★ 802
CopulasCopulas 是一个用于对多元数据进行建模的 Python 库,它基于 copula 理论(一种将变量间依赖结构与边缘分布分离的统计方法)来生成合成数据。它解★ 653
EnterpriseRAG-BenchEnterpriseRAG-Bench 是一个专为企业内部文档场景设计的 RAG(检索增强生成)评测基准与数据集。它解决的核心问题是:通用 RAG 评测集(如自★ 576
edsledsl 是一个用于设计、执行和分析 AI 驱动调查与实验的开源 Python 框架。它解决的核心问题是:传统社会科学和市场研究依赖真人样本,成本高、周期长,且★ 502
OmniWorldOmniWorld 是一个面向 4D 世界建模的多领域、多模态数据集,由 ICLR 2026 论文提出。它旨在解决当前视频生成和世界模型研究中数据单一、缺乏空间★ 498
dbldatagendbldatagen 是 Databricks Labs 推出的开源合成数据生成工具,专为 Databricks 环境设计,也可在 Spark 集群上运行。它解★ 498
be_greatbe_great 是一个基于预训练大语言模型(LLM)生成合成表格数据的开源工具。它解决了真实表格数据隐私保护、数据稀缺和不平衡等问题,通过利用 LLM 的上下★ 370
awesome-data-centric-ai这是一个关于数据为中心AI(Data-Centric AI)的精选资源列表,汇集了开源软件、教程和研究论文。它旨在解决AI开发中数据质量、标注、增强等问题,强调★ 357
AgMLAgML 是一个面向农业机器学习的集中式框架,旨在解决农业领域深度学习研究中数据分散、基准不统一、模型复用难的问题。它聚合了多个公开农业数据集,覆盖图像分类、目★ 344
awesome-synthetic-datasets这是一个精选合成文本数据集和生成工具的资源列表,旨在帮助AI开发者解决真实数据获取难、成本高、隐私风险大等问题。项目系统梳理了各类合成数据资源,包括通用指令数据★ 342
kodcodekodcode 是一个合成数据集生成框架,专门用于创建多样化的编程题目和可验证的解决方案。它解决的是高质量代码生成模型训练数据稀缺的问题,通过自动化流程生成带测★ 321
SDGymSDGym 是一个用于基准测试合成数据生成方法的开源工具,由 SDV 团队开发。它解决了如何公平、系统地评估不同合成数据生成算法性能的问题。SDGym 提供了一★ 311
gen-fraud-graphgen-fraud-graph 是一个用于生成合成欺诈图数据的开源工具,专门服务于金融领域基于图的欺诈检测模型基准测试。它解决了真实金融欺诈数据难以获取、隐私敏★ 284
SDMetricsSDMetrics 是一个用于评估合成数据质量的 Python 库,由 SDV 团队开发。它提供了一套全面的指标,从统计相似性、数据隐私、数据完整性和机器学习效★ 263
omnisimomnisim 是一个面向编码智能体的开源机器人模拟器,旨在为 AI 智能体提供可复现的机器人操作与测试环境。它通过 HTTP/JSON 和 MCP(模型上下文★ 185
APTMAPTM 是论文《Towards Unified Text-based Person Retrieval: A Large-scale Multi-Attrib★ 177
rapiddweller-benerator-ceBenerator 是一个基于模型驱动的数据生成与处理工具,主要解决开发、测试和培训场景中需要大量真实感数据的问题。它不仅能生成模拟数据,还支持数据脱敏(匿名化★ 162
DeepEchoDeepEcho 是一个专注于混合类型、多变量时间序列数据的合成数据生成库。它解决的是在数据隐私保护、数据增强和模型开发中,真实时间序列数据难以获取或使用受限的★ 125
DPSDADPSDA 是一个专注于差分隐私(DP)合成数据生成的开源项目,核心思想是“私有进化”(Private Evolution),旨在在不训练生成模型(如 GAN ★ 117
anonymeteranonymeter 是一个专注于量化合成数据隐私风险的开源框架,依据欧盟 GDPR 法规设计。它解决的核心问题是:当使用合成数据替代真实数据时,如何评估数据泄★ 109
plurelPluRel 是一个用于生成合成表格与关系数据的 Python 框架。它解决的是在数据隐私保护、机器学习模型开发、软件测试等场景下,真实数据难以获取或使用受限的★ 76
DataGenDataGen 是一个基于大型语言模型(LLM)的统一合成数据集生成框架,相关论文已被 ICLR 2025 接收。它旨在解决真实数据获取成本高、隐私受限以及特定★ 69
VisionFoundryVisionFoundry 是一个专注于提升视觉语言模型(VLM)视觉感知能力的开源训练框架。它通过合成图像数据来训练模型,解决真实图像数据稀缺、标注成本高的问★ 57
synthetic-user-research这是一个用于合成用户研究的示例笔记本,通过角色提示(Persona Prompting)和自主智能体(Autonomous Agents)生成模拟用户反馈。它主★ 52