data-generation

本站收录 10 个带「data-generation」标签的 AI 开源项目

SDVSDV(Synthetic Data Vault)是一个用于表格数据合成生成的Python库,旨在解决真实数据隐私保护、数据稀缺和测试数据获取难的问题。它提供了★ 3,567DataDesignerDataDesigner 是 NVIDIA 开源的合成数据生成工具,基于 NeMo 框架构建。它解决的是高质量训练数据获取难、成本高的问题,允许用户从零开始或基★ 2,293CTGANCTGAN 是一个基于条件生成对抗网络(Conditional GAN)的合成表格数据生成工具。它解决真实表格数据隐私保护、数据不平衡、样本不足等问题,通过深度★ 1,571GraphGenGraphGen 是一个面向大语言模型监督微调的数据合成框架,核心思路是用知识图谱驱动合成数据生成。它从给定知识源(如文档、知识库)中抽取实体与关系,构建知识图★ 1,226CopulasCopulas 是一个用于对多元数据进行建模的 Python 库,它基于 copula 理论(一种将变量间依赖结构与边缘分布分离的统计方法)来生成合成数据。它解★ 653dbldatagendbldatagen 是 Databricks Labs 推出的开源合成数据生成工具,专为 Databricks 环境设计,也可在 Spark 集群上运行。它解★ 498be_greatbe_great 是一个基于预训练大语言模型(LLM)生成合成表格数据的开源工具。它解决了真实表格数据隐私保护、数据稀缺和不平衡等问题,通过利用 LLM 的上下★ 370rapiddweller-benerator-ceBenerator 是一个基于模型驱动的数据生成与处理工具,主要解决开发、测试和培训场景中需要大量真实感数据的问题。它不仅能生成模拟数据,还支持数据脱敏(匿名化★ 162DeepEchoDeepEcho 是一个专注于混合类型、多变量时间序列数据的合成数据生成库。它解决的是在数据隐私保护、数据增强和模型开发中,真实时间序列数据难以获取或使用受限的★ 125Gen4GenGen4Gen 是一个用于生成式多概念组合的图像数据管线,旨在解决文本到图像模型中多概念组合生成质量不佳的问题。它通过利用 LLM 和 Stable Diffu★ 110