ScienceAgentBench 是评测安全领域的开源项目,由 OSU-NLP-Group 开发,2024 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 173。
项目仍在小幅维护中,最近一次代码更新于 2026-09-21。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:科研人员评估LLM在数据驱动科研任务中的实际能力。同类可对比的替代方案包括 AgentBench、SciBench、MLAgentBench。

用102个真实科研任务,严格检验AI科学智能体成色
ScienceAgentBench 是一个面向数据驱动科学发现的语言智能体评估基准,由加州大学等机构在 ICLR 2025 提出。它旨在解决当前科学智能体评估中任务过于简单、数据泄露和评估不严谨的问题,通过构建 102 个来自四个科学领域(数据挖掘、方程建模、数据可视化、机器学习)的高质量任务,覆盖 30 个数据集,并采用严格的输出验证和端到端评估协议,确保对智能体能力的真实衡量。该基准支持多种主流语言模型(如 GPT-4、Claude 等)作为后端,提供统一的评估脚本和 Docker 环境,可自动生成科学发现报告并验证结果正确性。其核心价值在于为科学智能体研究提供一个标准化、可复现的测试平台,推动 AI 在科研自动化中的可靠应用。
AgentBench、SciBench、MLAgentBench
ScienceAgentBench 是评测安全领域的开源项目,由 OSU-NLP-Group 开发,2024 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 173。
项目仍在小幅维护中,最近一次代码更新于 2026-09-21。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:科研人员评估LLM在数据驱动科研任务中的实际能力。同类可对比的替代方案包括 AgentBench、SciBench、MLAgentBench。
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.