ResearchClawBench

给AI科研智能体打分,从复现实验到发现新知识

ResearchClawBench 是一个用于评估 AI 智能体在自动化科研任务中能力的基准测试平台,覆盖从“重新发现”已知科学结论到“新发现”未知规律的完整科研流程。它解决的核心问题是:当前 AI 智能体在真实科研场景下的自主性、准确性和可复现性缺乏统一衡量标准。平台提供端到端的评估框架,支持 Claude Code、Codex 等主流编程智能体,通过标准化任务集、自动评分和结果对比,帮助研究者量化不同智能体的科研潜力。其技术栈基于 Jupyter Notebook,集成 agent、ai-scientist、ai4science 等工具链,强调从数据采集、假设生成到实验验证的全流程自动化评估。作为早期项目(237 星),它填补了 AI for Science 领域在智能体评估方面的空白,为构建更可靠的科研助手提供参考基准。

开源 free 智能体
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 264
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类智能体
开发团队InternScience
所属国家
定价模式free
价格说明开源项目,提供在线文档和演示页面,核心功能免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Jupyter Notebook
技术栈/模型agent,ai,ai-agent,ai-scientist,ai4science,auto-research,benchmark,claude,claude-code,clawdbot,codex,discovery,end-to-end,evaluation,llm,openai,openclaw,research-claw,science
GitHub 星标★ 264
30天Star增速
HF 下载量
上线时间2026-03-18 00:00:00
最近更新2026-09-21 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 首创从重新发现到新发现的科研能力分级评估体系
  • 支持 Claude Code、Codex 等主流智能体,开箱即用
  • 端到端自动化评估,覆盖完整科研流程而非单点任务

不足之处

  • 项目处于早期,文档和社区生态待观察
  • 评估任务集可能偏向计算类学科,泛化性待验证

适用场景

  • 对比不同AI智能体的科研自主性
  • 优化科研智能体在假设生成与验证环节的性能
  • 为AI for Science研究提供标准化评估工具

替代项目

AI Scientist、MLAgentBench、ChemBench

项目介绍

ResearchClawBench 是评测安全领域的开源项目,由 InternScience 开发,是 2026 年新上线的项目。

它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 264。

近 43 天,它的 GitHub 星标从 237 增加到 264,净增 27。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-21。提供在线文档和演示页面,核心功能免费,无付费版本。从国内网络环境看,可直接访问。

它主要面向的使用场景是:对比不同AI智能体的科研自主性。同类可对比的替代方案包括 AI Scientist、MLAgentBench、ChemBench。

上一篇:agentseal

下一篇:myclaw-bench

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12