CompBioDatasetsForMachineLearning 是数据集领域的开源项目,由 AdaptInfer 开发,2016 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 205。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-10。开源免费的数据集清单。
它主要面向的使用场景是:机器学习课题起步时快速筛选可用生物医学数据集。同类可对比的替代方案包括 awesome-bio-datasets、OpenBioML。

生物医学机器学习数据集一网打尽,找数据不再翻论文
这是一个面向计算生物学与生物医学机器学习的数据集索引清单,把散落在论文、数据库和竞赛平台中的可用数据集整理成结构化列表,解决研究者找数据难、格式不统一、不知道哪些数据适合训练模型的问题。项目按任务类型(如蛋白质结构预测、基因表达、药物发现、单细胞分析等)和数据类型分类,给出数据集名称、来源链接与简要说明,方便快速筛选。核心能力是人工策展与持续更新,把公开可用的生物医学数据集中到一处,降低数据检索成本,适合作为课题起步、基准测试选型和教学素材的入口。它本身不提供数据下载或预处理工具,而是导航式资源集合。
awesome-bio-datasets、OpenBioML
CompBioDatasetsForMachineLearning 是数据集领域的开源项目,由 AdaptInfer 开发,2016 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 205。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-10。开源免费的数据集清单。
它主要面向的使用场景是:机器学习课题起步时快速筛选可用生物医学数据集。同类可对比的替代方案包括 awesome-bio-datasets、OpenBioML。
下一篇:bigset-oss
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models