synthetic-dataset-generation

本站收录 12 个带「synthetic-dataset-generation」标签的 AI 开源项目

distilabelDistilabel 是一个面向工程师的合成数据与 AI 反馈框架,旨在帮助用户快速构建可靠、可扩展的数据流水线。它基于经过验证的研究论文,将复杂的合成数据生成★ 3,401curatorcurator 是一个专注于合成数据策展的开源工具,主要服务于大语言模型的后训练阶段和结构化数据提取。它解决了高质量训练数据难以获取、合成数据质量参差不齐的问题★ 1,736DataDreamerDataDreamer 是一个专注于合成数据生成与模型训练对齐的开源 Python 库。它解决的核心问题是:在真实数据稀缺或受隐私限制时,如何通过提示词(Pro★ 1,121VQASynthVQASynth 是一个面向多模态数据集构建的开源工具,核心目标是把普通图像或视频转化为带有空间推理能力的视觉问答(VQA)训练数据。它通过场景重建与空间关系抽★ 591be_greatbe_great 是一个基于预训练大语言模型(LLM)生成合成表格数据的开源工具。它解决了真实表格数据隐私保护、数据稀缺和不平衡等问题,通过利用 LLM 的上下★ 370HumanVidHumanVid 是一个面向人体视频生成的开源项目,发表于 NeurIPS 2024 D&B Track。它主要解决高质量、可控的人体视频数据稀缺问题,通过结合★ 350awesome-synthetic-datasets这是一个精选合成文本数据集和生成工具的资源列表,旨在帮助AI开发者解决真实数据获取难、成本高、隐私风险大等问题。项目系统梳理了各类合成数据资源,包括通用指令数据★ 342kodcodekodcode 是一个合成数据集生成框架,专门用于创建多样化的编程题目和可验证的解决方案。它解决的是高质量代码生成模型训练数据稀缺的问题,通过自动化流程生成带测★ 321pandapanda 是一个面向非线性动力学系统的开源模型,基于“修补注意力”(Patched Attention)机制,相关论文已被 ICLR 2026 接收。它解决的★ 175sdg_hubsdg_hub 是一个面向大语言模型的合成数据生成工具包,目标是帮助开发者低成本、可复现地构造高质量训练与微调数据集。它把合成数据流程拆解为可组合的模块,覆盖种★ 163syncdSynCD 是一个用于文本到图像定制化(Text-to-Image Customization)的合成数据生成工具,源自 ICCV 2025 论文。它解决的是个★ 156VisionFoundryVisionFoundry 是一个专注于提升视觉语言模型(VLM)视觉感知能力的开源训练框架。它通过合成图像数据来训练模型,解决真实图像数据稀缺、标注成本高的问★ 57