Mol-Instructions 是数据集领域的开源项目,由 zjunlp 开发,2023 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 294。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-24。开源数据集,MIT许可证,完全免费,可自行下载使用。
它主要面向的使用场景是:药物研发中,利用LLM生成候选分子结构。同类可对比的替代方案包括 MolT5、Text2Mol、ChemData。

用大规模指令数据,让大模型精通生物分子任务
Mol-Instructions 是一个面向生物分子领域的大规模指令数据集,旨在增强大型语言模型(LLM)在生物分子理解与生成任务上的能力。它解决了通用LLM在生物分子(如分子、蛋白质、DNA/RNA)专业任务上表现不佳的问题,通过提供超过200万条指令数据,覆盖分子理解、分子生成、蛋白质理解、蛋白质生成、生物分子设计等多个子任务。该数据集基于ICLR 2024论文,采用结构化指令格式,支持微调LLM以执行跨模态生物分子任务,例如从文本生成分子结构、预测蛋白质功能等。核心能力包括:大规模高质量指令数据、多任务覆盖、与主流LLM框架兼容。它为生物信息学和药物研发领域的AI应用提供了关键训练资源,推动LLM在生命科学中的落地。
MolT5、Text2Mol、ChemData
Mol-Instructions 是数据集领域的开源项目,由 zjunlp 开发,2023 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 294。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-24。开源数据集,MIT许可证,完全免费,可自行下载使用。
它主要面向的使用场景是:药物研发中,利用LLM生成候选分子结构。同类可对比的替代方案包括 MolT5、Text2Mol、ChemData。
下一篇:meerkat
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models