plinder 是数据集领域的开源项目,由 plinder-org 开发,2024 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 312。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-17。开源数据集,官网可免费访问下载。从国内网络环境看,可用性暂无实测数据。
它主要面向的使用场景是:训练和评估蛋白质-配体亲和力预测模型时,作为统一基准数据集。同类可对比的替代方案包括 PDBbind、DUD-E、CrossDocked2020。

统一蛋白质-配体数据与评测,让模型对比更公平
plinder 是一个面向蛋白质-配体相互作用研究的开源数据集与评测资源,全称 Protein Ligand INteraction Dataset and Evaluation Resource。它解决的核心问题是:在药物发现和结构生物学中,不同研究使用的训练/测试划分标准不统一,导致模型性能难以公平比较。plinder 提供经过整理、去冗余的蛋白质-配体复合物数据,并配套标准化的评测协议,让研究者能在同一基准上训练和评估打分函数、对接模型、亲和力预测等任务。项目以 Python 实现,包含数据下载、预处理、划分与评测工具,支持从原始结构到可用数据集的完整流程。其核心能力包括:统一的数据清洗与质量控制、基于序列和结构的冗余去除、可复现的训练/验证/测试划分,以及面向常见任务的评测指标。适合计算化学、AI 制药和结构生物信息学团队作为基准数据源使用。
PDBbind、DUD-E、CrossDocked2020
plinder 是数据集领域的开源项目,由 plinder-org 开发,2024 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 312。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-17。开源数据集,官网可免费访问下载。从国内网络环境看,可用性暂无实测数据。
它主要面向的使用场景是:训练和评估蛋白质-配体亲和力预测模型时,作为统一基准数据集。同类可对比的替代方案包括 PDBbind、DUD-E、CrossDocked2020。
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models