dataset-generation
本站收录 12 个带「dataset-generation」标签的 AI 开源项目
KilnKiln 是一个面向 AI 系统的全流程开发平台,旨在解决从数据准备到模型优化过程中工具链割裂、协作困难的问题。它提供数据集管理、人工标注与协作、评估(eval★ 5,130
ChatitoChatito 是一个用于生成 AI 聊天机器人、NLP 任务、命名实体识别或文本分类模型训练数据集的开源工具。它通过一种简洁的领域特定语言(DSL)来描述对话★ 890
VQASynthVQASynth 是一个面向多模态数据集构建的开源工具,核心目标是把普通图像或视频转化为带有空间推理能力的视觉问答(VQA)训练数据。它通过场景重建与空间关系抽★ 591
ImageIndexerImageIndexer 是一个本地优先的图像索引与标注工具,用 Python 编写。它解决的是个人或小团队海量图片难以检索和管理的问题。核心能力是自动扫描指定★ 397
ChatetteChatette 是一个为 Rasa NLU 量身打造的训练数据集生成器,灵感来自 Chatito。它通过一种简洁的模板语法,让开发者用类似自然语言的方式定义意★ 315
stopesstopes 是由 Meta AI 的 FAIR NLLB 团队开发的数据集准备库,专为机器翻译研究设计。它解决的核心问题是多语言翻译数据处理的复杂性,提供从单★ 312
speech-dataset-generatorspeech-dataset-generator 是一个用于创建带标签语音数据集的 Python 工具,主要解决语音识别、说话人识别等任务中训练数据难以获取和标★ 263
prontoqaProntoQA 是一个用于正式分析大语言模型在推理任务中思维链输出的合成问答数据集。它通过生成结构化的推理问题,帮助研究者和开发者评估模型在复杂逻辑推理上的表★ 168
image-rankerimage-ranker 是一个在浏览器中通过两两对比来给图像排序的开源工具,基于 TrueSkill 算法。它主要解决图像数据集构建和排序中的主观评估问题,让★ 92
Vec2FaceVec2Face 是 ICLR 2025 收录的官方实现,旨在解决人脸数据集生成中的规模与多样性瓶颈。传统方法依赖精确条件控制(如文本、属性标签),而 Vec2★ 91
DataGenDataGen 是一个基于大型语言模型(LLM)的统一合成数据集生成框架,相关论文已被 ICLR 2025 接收。它旨在解决真实数据获取成本高、隐私受限以及特定★ 69
TTSGTTSG是一个面向自动驾驶场景生成的开源项目,核心功能是根据自然语言描述自动生成交通场景。它利用大语言模型理解用户输入的文字描述,将其转化为结构化的交通场景配置★ 67