plinder

统一蛋白质-配体数据与评测,让模型对比更公平

plinder 是一个面向蛋白质-配体相互作用研究的开源数据集与评测资源,全称 Protein Ligand INteraction Dataset and Evaluation Resource。它解决的核心问题是:在药物发现和结构生物学中,不同研究使用的训练/测试划分标准不统一,导致模型性能难以公平比较。plinder 提供经过整理、去冗余的蛋白质-配体复合物数据,并配套标准化的评测协议,让研究者能在同一基准上训练和评估打分函数、对接模型、亲和力预测等任务。项目以 Python 实现,包含数据下载、预处理、划分与评测工具,支持从原始结构到可用数据集的完整流程。其核心能力包括:统一的数据清洗与质量控制、基于序列和结构的冗余去除、可复现的训练/验证/测试划分,以及面向常见任务的评测指标。适合计算化学、AI 制药和结构生物信息学团队作为基准数据源使用。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 312
维护状态 活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队plinder-org
所属国家
官网地址https://plinder.sh
定价模式free
价格说明开源数据集,官网可免费访问下载
访问状态
是否开源
开源协议GPL-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 312
30天Star增速
HF 下载量
上线时间2024-07-17 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-21
浏览次数0

使用教程

核心亮点

  • 提供标准化数据划分与评测协议,减少不同论文间因划分差异导致的性能不可比问题
  • 包含数据清洗、去冗余和质量控制流程,可直接生成可复现的训练/测试集
  • Python 工具链完整,覆盖从原始结构下载到评测指标计算的端到端使用

不足之处

  • 项目星标数较少,社区生态和第三方集成尚在早期
  • 文档和示例可能不够丰富,新用户上手需要一定结构生物学背景

适用场景

  • 训练和评估蛋白质-配体亲和力预测模型时,作为统一基准数据集
  • 开发分子对接或打分函数时,用标准化测试集对比不同算法性能
  • AI 制药团队构建内部数据管道时,参考其去冗余与划分策略

替代项目

PDBbind、DUD-E、CrossDocked2020

项目介绍

plinder 是数据集领域的开源项目,由 plinder-org 开发,2024 年首次发布。

它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 312。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-17。开源数据集,官网可免费访问下载。从国内网络环境看,可用性暂无实测数据。

它主要面向的使用场景是:训练和评估蛋白质-配体亲和力预测模型时,作为统一基准数据集。同类可对比的替代方案包括 PDBbind、DUD-E、CrossDocked2020。

上一篇:masader

下一篇:arco-era5

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10496 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1643 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3395 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09