dataset

本站收录 132 个带「dataset」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

label-studio支持多类型数据标注的开源工具,覆盖图像、文本、音频、视频等多种数据格式,输出格式标准化,方便直接对接模型训练流程。提供灵活的标注界面、协作审核机制与丰富的集成能★ 28,371exercises-dataset这是一个包含1324个健身动作的结构化数据集,为健身应用开发者提供标准化的动作数据层。项目解决了健身类App开发中动作数据零散、格式不统一、多语言支持困难等问题★ 22,403fakerFaker 是一个 Python 库,用于生成各种逼真的假数据,如姓名、地址、邮箱、电话、文本、日期、公司信息等。它解决了开发、测试和演示阶段需要大量真实感数据★ 19,415cvatCVAT(Computer Vision Annotation Tool)是一个开源的计算机视觉标注平台,旨在帮助AI团队高效构建高质量视觉数据集。它解决了从原★ 16,821easy-dataseteasy-dataset 是一个用于创建大语言模型(LLM)微调、RAG 和评估数据集的强大工具。它主要解决 AI 开发者在构建高质量训练数据时面临的痛点,如数★ 14,962techniques这是一个专注于卫星与航空影像深度学习技术的开源项目,汇集了针对地球观测数据的卷积神经网络、数据集构建、图像分类等核心方法。它解决了遥感领域缺乏系统化深度学习实践★ 10,269browser-compat-databrowser-compat-data 是 MDN 官方维护的浏览器兼容性数据集,以 JSON 格式存储 Web 技术(如 CSS、JavaScript、HTM★ 5,759awesome-pretrained-chinese-nlp-models这是一个高质量中文预训练模型、大模型、多模态模型及大语言模型的精选集合,旨在为中文NLP从业者提供一站式模型资源导航。项目系统整理了从BERT、GPT到LLaM★ 5,593llm-datasetsllm-datasets 是一个精选的大语言模型后训练数据集与工具清单,旨在帮助研究者和工程师快速找到高质量的数据资源。它系统梳理了用于指令微调、偏好对齐、持续★ 4,794esProcesProc SPL 是一款基于 JVM 的编程语言,专为结构化数据计算而设计,既可作为独立的数据分析工具,也可作为嵌入式计算引擎集成到应用中。它致力于解决传统★ 4,684datasetsTFDS(TensorFlow Datasets)是一个开源的机器学习数据集库,旨在为 TensorFlow、JAX 等框架提供即用型数据集。它解决了研究人员和★ 4,594csghubCSGHub 是由 OpenCSG 团队开发的开源大模型管理平台,旨在提供类似 Hugging Face 的功能,但支持私有化部署和 SaaS 两种模式。它帮助★ 4,117awesome-industrial-anomaly-detection这是一个持续更新的工业图像异常/缺陷检测论文与数据集检索库,汇集了该领域从经典到前沿的学术资源。项目按任务类型(如异常检测、异常分割、缺陷分类)和数据集(如MV★ 3,803StringZillaStringZilla 是一个跨语言的高性能字符串处理库,专为加速字符串搜索、哈希、排序、编辑距离计算、相似度草图和内存操作而设计。它利用现代 CPU 的 SI★ 3,569LLMDataHubLLMDataHub 是一个面向大语言模型(LLM)指令微调数据集的速查指南,尤其关注当下流行的数据集。它旨在解决研究人员和开发者难以快速找到高质量、适合特定任★ 3,416pandas-datareaderpandas-datareader 是一个 Python 库,用于从多种互联网数据源获取金融和经济数据,并将其直接转换为 pandas DataFrame 格式★ 3,271color-namescolor-names 是一个精心挑选的大型颜色名称数据集,收录了数千个颜色名称及其对应的 RGB 值。它解决了开发者在设计或开发中需要为颜色命名或查找颜色名称★ 3,002WhatsMyNameWhatsMyName 是一个由社区维护的开源数据集,收录了 700 多个网站的账号枚举规则,用于通过用户名查找用户在各平台上的注册信息。它解决了 OSINT(★ 2,906whylogswhylogs 是一个开源的数据日志库,专为机器学习模型和数据管道设计。它通过轻量级的日志记录,持续收集数据分布、统计特征和模型性能指标,帮助团队实时监控数据质★ 2,833colourColour 是一个专注于色彩科学的 Python 库,为研究人员、开发者和艺术家提供全面的颜色处理、转换和分析工具。它解决了色彩空间中颜色表示不一致、转换复杂★ 2,658Awesome-Domain-LLMAwesome-Domain-LLM 是一个精选列表,系统收集和整理了垂直领域(如金融、医疗、法律、教育等)的开源大语言模型、相关数据集及评测基准。它解决的是领★ 2,585webgradientsWebGradients 是一个免费的开源渐变配色资源库,提供 180 种精心设计的 CSS3 渐变方案,并支持 Figma、Sketch、PSD 等设计工具格★ 2,481awesome-remote-sensing-change-detection这是一个遥感变化检测领域的精选资源列表,汇总了该方向的数据集、工具、方法、综述论文和竞赛。它解决了遥感变化检测研究者和工程师难以系统获取和筛选分散资源的问题,通★ 2,344beirBEIR是一个异构信息检索基准测试平台,旨在解决IR模型评估碎片化的问题。它整合了超过15个多样化的检索数据集,覆盖问答、生物医学、金融、法律等多个领域,并提供★ 2,305Dialog_CorpusDialog_Corpus 是一个面向中英文对话系统训练的开源语料库项目,旨在解决聊天机器人开发中高质量对话数据稀缺的问题。项目收集并整理了多种来源的对话数据,★ 2,055fastdupfastdup 是一个开源的图像与视频数据集分析工具,旨在帮助深度学习从业者快速发现数据集中的问题并提升数据质量。它通过高效的算法在短时间内扫描海量数据,自动识★ 1,911graph-fraud-detection-papers这是一个精选的图神经网络与Transformer在欺诈检测、异常检测和离群点检测领域的论文与资源列表。项目系统整理了基于图结构(如GNN、Graph Trans★ 1,897vietnamese-provinces-database这是一个为越南行政区划量身打造的开源数据集,覆盖了从省级、县级到乡级的完整行政单位信息,并附带GIS地理空间边界数据。它解决了开发者在构建越南本地化应用时,因行★ 1,813VBenchVBench 是一个专为视频生成模型设计的综合评估基准,由 CVPR 2024 Highlight 论文提出。它解决了视频生成领域缺乏统一、细粒度、自动化评估标★ 1,800EmoLLMEmoLLM 是一个专注于心理健康领域的大语言模型项目,旨在通过微调开源基座模型(如 InternLM、Qwen、Baichuan、DeepSeek 等)来提供★ 1,788Jackrong-llm-finetuning-guide这是一个面向开发者的 LLM 微调实战指南,基于 Jupyter Notebook 形式,系统讲解从数据准备、模型选择、参数调整到训练评估的完整流程。项目旨在解★ 1,701DataProfilerDataProfiler 是一个开源的数据分析工具,用于快速提取数据集的模式(schema)、统计信息和实体标签。它解决的核心问题是帮助数据科学家和工程师在拿到★ 1,591chatgpt-comparison-detection这是一个用于检测文本是否由ChatGPT等大型语言模型生成的工具集,核心是发布了Human ChatGPT Comparison Corpus (HC3)数据集★ 1,470anime-offline-databaseanime-offline-database 是一个开源的动漫元数据数据集,以 JSON 格式提供最核心的动漫信息,并整合了多个主流动漫网站(如 MyAnime★ 1,326BTC-Trading-Since-2020这是一个公开的比特币交易数据集,自2020年起持续记录BTC交易上下文信息,涵盖BitMEX等平台的交易数据。项目旨在为加密货币交易研究、策略回测和AI模型训练★ 1,223M2DGRM2DGR是一个面向地面机器人的多模态、多场景数据集,由上海交通大学发布,相关论文发表于RA-L 2021和ICRA 2022。该数据集旨在解决地面机器人在复杂★ 1,209torchxrayvisionTorchXRayVision 是一个面向胸部 X 光影像的开源工具库,集成了多个公开数据集和预训练模型,覆盖分类、分割和自编码器三大任务。它解决了医学影像研究★ 1,201game-datasets这是一个精选的游戏数据集和人工智能工具清单,旨在为游戏AI研究和开发提供一站式资源导航。项目收集了从Atari、NES到现代3A游戏的各种数据集,涵盖游戏截图、★ 1,129insuranceqa-corpus-zh这是一个面向保险行业的中文语料库,专为训练聊天机器人和自然语言处理模型而设计。它解决了保险领域缺乏高质量、结构化问答数据的问题,提供了大量真实的保险咨询问题和对★ 1,068APSDAPSD 是论文《从视觉角度评估对抗扰动的隐蔽性》的官方数据集,旨在解决对抗样本攻击中扰动隐蔽性难以量化评估的问题。该数据集提供了大量带有对抗扰动的图像样本,并★ 939ClawBenchClawBench 是一个开源的浏览器 AI 智能体基准测试项目,专注于评估 AI 智能体在真实日常任务中的表现。它解决了当前浏览器智能体缺乏统一、贴近真实场景★ 904ChatitoChatito 是一个用于生成 AI 聊天机器人、NLP 任务、命名实体识别或文本分类模型训练数据集的开源工具。它通过一种简洁的领域特定语言(DSL)来描述对话★ 890deepfabricdeepfabric 是一个面向 AI 数据工程的一体化流水线工具,旨在解决高质量合成数据生成、模型训练、评估与蒸馏的割裂问题。它提供从数据生成到模型优化的完整★ 886OpenCUAOpenCUA 是一个为计算机使用智能体(Computer-Use Agents)提供开放基础的开源项目,入选 NeurIPS 2025 Spotlight。它★ 849opendataopendata 是美国国家美术馆(National Gallery of Art)推出的开放数据项目,旨在将馆藏艺术品元数据以结构化格式(如 CSV)公开,供★ 832Total-Text-DatasetTotal-Text-Dataset 是一个用于场景文本检测与识别的公开数据集,包含1555张图像,覆盖水平、多方向和弯曲三种文本形态,尤其以弯曲文本为特色,是★ 772awesome-chatgpt-dataset这是一个收集用于训练和微调ChatGPT等大语言模型的数据集列表。它整理了多种类型的公开数据集,包括指令数据、对话数据、人类反馈数据等,帮助开发者快速找到适合自★ 770tech.ml.datasettech.ml.dataset 是一个基于 Clojure 的高性能数据处理系统,专注于提供类似 Python pandas 的 DataFrame 功能,同时★ 763dataset-serializedataset-serialize 是一个面向 Delphi 和 Lazarus (FPC) 开发者的数据集序列化工具,主要解决 DataSet 与 JSON ★ 744biblebible 是一个开源的多语言圣经文本数据集,以 JSON 和 XML 两种结构化格式提供,覆盖 35 种语言的 90 个圣经版本。它解决的是开发者、研究者和内★ 742