ScienceAgentBench

用102个真实科研任务,严格检验AI科学智能体成色

ScienceAgentBench 是一个面向数据驱动科学发现的语言智能体评估基准,由加州大学等机构在 ICLR 2025 提出。它旨在解决当前科学智能体评估中任务过于简单、数据泄露和评估不严谨的问题,通过构建 102 个来自四个科学领域(数据挖掘、方程建模、数据可视化、机器学习)的高质量任务,覆盖 30 个数据集,并采用严格的输出验证和端到端评估协议,确保对智能体能力的真实衡量。该基准支持多种主流语言模型(如 GPT-4、Claude 等)作为后端,提供统一的评估脚本和 Docker 环境,可自动生成科学发现报告并验证结果正确性。其核心价值在于为科学智能体研究提供一个标准化、可复现的测试平台,推动 AI 在科研自动化中的可靠应用。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 173
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队OSU-NLP-Group
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型ai4science,bioinformatics,chemoinformatics,code-generation,cognitive-neuroscience,geoscience,language-agent,large-language-models,task-automation
GitHub 星标★ 173
30天Star增速
HF 下载量
上线时间2024-10-02 00:00:00
最近更新2026-09-21 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 任务覆盖四个科学领域,包含数据挖掘、方程建模等,贴近真实科研流程
  • 采用严格输出验证和端到端评估,避免数据泄露和过拟合问题
  • 提供 Docker 环境和统一评估脚本,易于复现和扩展新模型

不足之处

  • 项目处于早期阶段,文档和社区支持尚待完善
  • 评估依赖外部 LLM API,可能产生一定使用成本

适用场景

  • 科研人员评估 LLM 在数据驱动科研任务中的实际能力
  • AI 开发者测试和比较不同语言智能体在科学发现上的表现
  • 高校或研究机构作为课程或实验室的基准测试工具

替代项目

AgentBench、SciBench、MLAgentBench

项目介绍

ScienceAgentBench 是评测安全领域的开源项目,由 OSU-NLP-Group 开发,2024 年首次发布。

它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 173。

项目仍在小幅维护中,最近一次代码更新于 2026-09-21。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:科研人员评估LLM在数据驱动科研任务中的实际能力。同类可对比的替代方案包括 AgentBench、SciBench、MLAgentBench。

上一篇:MathVista

下一篇:SemBench

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12