datasets

本站收录 55 个带「datasets」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

awesome-public-datasetsawesome-public-datasets 是一个以主题分类整理的公开数据集清单,核心价值在于把散落在政府门户、科研机构和开源社区的高质量开放数据集中到一处★ 79,255label-studio支持多类型数据标注的开源工具,覆盖图像、文本、音频、视频等多种数据格式,输出格式标准化,方便直接对接模型训练流程。提供灵活的标注界面、协作审核机制与丰富的集成能★ 28,371datasetsdatasets 是 Hugging Face 推出的开源数据集库,旨在成为 AI 模型就绪数据集的中心枢纽。它解决了机器学习从业者在数据获取、处理和加载过程中★ 22,016phoenixPhoenix 是一个面向 AI 应用的可观测性与评估平台,由 Arize AI 开发。它解决了 LLM 应用在生产环境中难以调试、评估和优化的问题,为开发者提★ 11,654datasetteDatasette 是一个基于 Python 和 SQLite 的开源数据探索与发布工具,由 Simon Willison 开发。它能把 CSV、JSON、SQ★ 11,499techniques这是一个专注于卫星与航空影像深度学习技术的开源项目,汇集了针对地球观测数据的卷积神经网络、数据集构建、图像分类等核心方法。它解决了遥感领域缺乏系统化深度学习实践★ 10,269langwatchLangWatch是一个面向LLM评估与AI智能体测试的开源平台,旨在解决大模型应用开发中评估难、调试烦、监控弱的问题。它提供从数据采集、数据集管理、评估实验到★ 4,888datasetsTFDS(TensorFlow Datasets)是一个开源的机器学习数据集库,旨在为 TensorFlow、JAX 等框架提供即用型数据集。它解决了研究人员和★ 4,594torchgeoTorchGeo 是微软开源的面向地理空间数据的 PyTorch 扩展库,为遥感、卫星影像和地球观测任务提供标准化的数据集、采样器、数据增强变换与预训练模型。它★ 4,192FlashRAGFlashRAG 是一个面向高效检索增强生成(RAG)研究的 Python 工具包,由 WWW2025 资源论文支持。它旨在解决 RAG 研究和应用中存在的复现★ 3,586Awesome-Code-LLMAwesome-Code-LLM 是一个精选的资源列表,收录了针对代码的语言模型研究论文、数据集和相关软件工程活动。它系统梳理了代码大模型领域的核心工作,包括模★ 3,440loghubLoghub 是一个面向 AI 日志分析研究的大型系统日志数据集集合,由香港中文大学等团队维护,论文发表于 ISSRE'23。它解决的核心问题是:日志分析领域长★ 2,864colourColour 是一个专注于色彩科学的 Python 库,为研究人员、开发者和艺术家提供全面的颜色处理、转换和分析工具。它解决了色彩空间中颜色表示不一致、转换复杂★ 2,658Open3D-MLOpen3D-ML 是 Open3D 的扩展库,专注于 3D 机器学习任务,如点云语义分割、物体检测和实例分割。它提供统一的数据集加载接口(支持 Semanti★ 2,351LLM4Rec-Awesome-PapersLLM4Rec-Awesome-Papers 是一个收录大语言模型(LLM)在推荐系统中应用的高质量论文与资源的精选列表。它系统性地整理了从2020年至今的相关★ 2,316DB-GPT-HubDB-GPT-Hub 是围绕 Text-to-SQL 任务打造的开源模型、数据集与微调技术仓库,旨在提升数据库自然语言查询的准确率。它解决了从模型选型、数据准备★ 2,012awesome-yolo-object-detectionawesome-yolo-object-detection 是一个精选 YOLO 目标检测系列开源项目和数据集的资源合集。它系统整理了 YOLO 从 v1 到 ★ 1,794MinariMinari 是面向离线强化学习(Offline RL)的数据集标准与工具库。它定义了统一的离线 RL 数据集格式,把不同来源、不同环境产生的轨迹数据(状态、动★ 1,776safe-rlhfSafe RLHF 是一个基于安全强化学习的人类反馈对齐框架,旨在解决大模型价值对齐中的安全问题。传统 RLHF 通过人类反馈优化模型行为,但可能忽略安全约束,★ 1,618kitopskitops 是一个来自 CNCF 的 DevOps 工具,用于将 AI/ML 模型、数据集、代码和配置打包并版本化为 OCI Artifact。它解决了 AI★ 1,423langtraceLangtrace 是一个基于 OpenTelemetry 的开源端到端可观测性工具,专为 LLM 应用设计。它解决开发者在构建大模型应用时面临的调试难、评估难★ 1,232datasets这是一个面向深度学习遥感应用的卫星与航空影像数据集汇总仓库,系统整理了地球观测领域常用的公开数据集资源。它解决的核心问题是:做遥感图像研究时,数据集分散在各国航★ 1,204csghub-serverCSGHub Server 是 CSGHub 平台的后端服务,用 Go 语言编写,面向大模型与数据资产的统一管理。它解决的是团队在模型、数据集、推理、微调和应用★ 1,051Prompt4ReasoningPapersPrompt4ReasoningPapers 是一个聚焦于语言模型提示(Prompting)推理能力的论文清单,源自 ACL 2023 综述《Reasoning★ 1,008ai-audio-datasets覆盖语音、音乐与音效的 AI 音频数据集合集,为生成式 AI、AIGC、模型训练与智能音频工具开发提供高质量训练数据,是构建音频 AI 应用、开展相关研究的实用★ 970dataset-viewerdataset-viewer 是 Hugging Face 官方开源的后端服务,为数据集页面上的在线预览功能提供公共 API。它解决的核心问题是:用户无需下载动★ 902awesome-instruction-datasets这是一个收录指令数据集的精选列表,旨在为训练类ChatGPT的对话大语言模型(如LLaMA、ChatLLM)提供高质量的训练数据资源。项目解决了研究人员和开发者★ 745datumarodatumaro 是一个面向计算机视觉的数据集管理框架,提供 Python 库和命令行工具,用于构建、分析和维护 CV 数据集。它解决的核心问题是深度学习项目中★ 692awesome-segmentation-saliency-dataset这是一个整理图像分割与显著性检测数据集的精选列表,旨在为相关领域的研究者和开发者提供一站式的数据集索引。项目收集了包括语义分割、实例分割、全景分割以及显著性目标★ 644awesome-synthetic-datasets这是一个精选合成文本数据集和生成工具的资源列表,旨在帮助AI开发者解决真实数据获取难、成本高、隐私风险大等问题。项目系统梳理了各类合成数据资源,包括通用指令数据★ 342vega-datasetsvega-datasets 是 Vega 生态的公共示例数据集仓库,为 Vega、Vega-Lite、Altair 等可视化工具提供统一、稳定的测试与演示数据源★ 311awesome-legal-dataawesome-legal-data 是一个面向法律文本处理的开源资源合集,主要收集法律领域的公开数据集、语料库及相关工具链接。它解决的核心问题是:法律 NLP★ 310Awesome-Interactive-World-Model这是一个关于交互式世界模型的论文与资源精选列表,旨在系统梳理该领域的前沿研究。项目按核心研究挑战(如3D、扩散模型、流式视频、数据集等)对论文进行分类,帮助研究★ 308Tegridy-MIDI-DatasetTegridy-MIDI-Dataset 是一个用于音乐 AI 模型训练的高质量 MIDI 数据集项目。它解决了音乐生成、转录等任务中缺乏干净、结构化 MIDI★ 296Mol-InstructionsMol-Instructions 是一个面向生物分子领域的大规模指令数据集,旨在增强大型语言模型(LLM)在生物分子理解与生成任务上的能力。它解决了通用LLM在★ 294HumanArtHumanArt 是 CVPR 2023 论文的官方实现,提供了一个连接自然与人工场景的多功能人类中心数据集。它解决了现有姿态估计和图像生成模型在非自然场景(如★ 290data-is-better-togetherdata-is-better-together 是一个面向机器学习社区的开源协作项目,核心目标是让开发者、研究者和数据标注者一起构建更高质量的数据集。它通过社区★ 276benchmark-radarbenchmark-radar 是一个面向 AI 评测领域的数据聚合工具,它从 37 个公开来源持续抓取并整理超过 11,923 条与 AI benchmark★ 263DeepLIIFDeepLIIF 是一个基于深度学习的多重免疫荧光图像分析工具,专注于免疫组化(IHC)图像的定量分析。它解决了病理学中传统人工定量分析主观性强、效率低、难以标★ 262hub这是一个已停运的Ultralytics HUB仓库,曾是Ultralytics推出的模型训练与管理平台,旨在简化YOLO系列模型的训练、部署和监控流程。用户可通★ 247unitxtUnitxt 是一个面向企业级 AI 性能评估的 Python 库,提供全球最大的工具和数据目录,用于端到端的 AI 基准测试。它解决了 AI 评估流程中数据准★ 216INTERSINTERS 是一个面向搜索场景的大语言模型指令微调开源项目,源自同名论文。它旨在解决通用大模型在信息检索任务中表现不佳的问题,通过构建大规模的搜索指令数据集,★ 208CompBioDatasetsForMachineLearning这是一个面向计算生物学与生物医学机器学习的数据集索引清单,把散落在论文、数据库和竞赛平台中的可用数据集整理成结构化列表,解决研究者找数据难、格式不统一、不知道哪★ 208masaderMasader 是面向阿拉伯语自然语言处理与语音领域的公开数据集目录,收录超过 500 个数据集,每个数据集标注了 25 项以上属性,如任务类型、数据规模、许可★ 208wildlife-datasetsWildlifeDatasets 是一个面向动物个体重识别(animal re-identification)的开源工具包与数据集集合,主要服务于生态学、保护生★ 201awesome-object-detection-datasets这是一个精选公共目标检测与识别数据集的资源列表,旨在帮助研究者和开发者快速找到适合自己任务的数据集。项目按类别整理了数十个公开数据集,涵盖通用目标检测、行人检测★ 144IMAGGarmentIMAGGarment 是一个面向数字时尚设计的细粒度服装生成工具,基于扩散模型实现可控的服装图像合成。它解决了传统服装设计中难以精确控制服装结构、颜色和图案的★ 132datasetsforecastdatasetsforecast 是一个专注时间序列预测的数据集加载与标准化工具,基于 Python 实现。它解决的核心问题是:时间序列预测研究里,不同论文和竞★ 129market_pricesmarket_prices 是一个 Python 工具库,专注于获取有意义的 OHLCV(开盘、最高、最低、收盘、成交量)金融数据集。它解决量化研究、回测和数据★ 106Awesome-Crack-Detection这是一个关于深度学习裂缝检测的论文列表,系统整理了该领域的核心文献。项目按学习范式(如监督、半监督、无监督)、泛化能力和数据集三个维度对论文进行分类,旨在帮助研★ 92