terminal-bench-science

让 AI 在终端里跑通真实科研任务并自动打分

Terminal-Bench-Science 是一个面向科研工作流的 AI 智能体评测基准,聚焦于评估 AI 在真实科学计算环境中的终端操作能力。它把化学、生物、物理、材料等学科中常见的科研任务(如数据处理、模拟运行、结果分析、脚本调试)转化为可复现的终端任务,让 AI 智能体在命令行里一步步完成,而不是只回答选择题。项目提供任务定义、环境配置、评分脚本和运行框架,解决现有基准偏通用编程、缺乏科学领域深度的问题,帮助研究者和开发者衡量智能体在科研场景下的实际可用性。核心能力包括跨学科任务集、可扩展的任务注册机制、基于终端的交互式执行与自动评分,适合用来对比不同模型或智能体框架在科研自动化上的表现。

开源 unknown 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 610
维护状态 活跃
是否开源
定价模式 unknown

项目数据

分类评测安全
开发团队harbor-framework
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型agentic-ai,ai-for-science,ai4science
GitHub 星标★ 610
30天Star增速
HF 下载量
上线时间2026-01-25 00:00:00
最近更新2026-09-21 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-22
浏览次数0

使用教程

核心亮点

  • 任务来自真实科研工作流,覆盖多学科终端操作,比通用编程基准更贴近科研场景
  • 提供可扩展的任务注册与自动评分框架,方便研究者加入新学科任务并复现结果
  • 基于终端交互执行,能评估智能体的多步规划、命令使用和错误恢复能力

不足之处

  • 项目处于早期,任务数量和学科覆盖仍在积累,评测结论的统计效力有限
  • 依赖具体终端环境与依赖安装,跨平台复现和任务稳定性需要额外维护

适用场景

  • 科研团队评测不同 AI 智能体在化学/生物数据分析流程中的自动化能力
  • 模型厂商用该基准展示自家智能体在科学终端任务上的表现
  • 研究者基于框架扩展新学科任务,构建自己的科研智能体评测集

替代项目

SWE-bench、AgentBench、ScienceAgentBench

项目介绍

terminal-bench-science 是评测安全领域的开源项目,由 harbor-framework 开发,是 2026 年新上线的项目。

它收录于评测安全分类,该分类目前共有 456 个项目,GitHub 星标数为 610。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-21。

它主要面向的使用场景是:科研团队评测不同AI智能体在化学/生物数据分析流程中的自动化能力。同类可对比的替代方案包括 SWE-bench、AgentBench、ScienceAgentBench。

上一篇:Semia

下一篇:没有了!

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2844 2026-09-12
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1354 2026-08-24