BrainBench

用神经科学实验预测题,测出AI比专家更懂科研

BrainBench 是论文《Large language models surpass human experts in predicting neuroscience results》的官方开源代码库,旨在评估和比较大型语言模型(LLM)与人类神经科学专家在预测实验结果方面的能力。该工具通过构建结构化的神经科学实验描述(包括背景、方法、结果等),让模型和专家分别预测实验的统计显著性结果,从而量化模型的科学推理水平。核心能力包括:提供标准化的评测数据集和评估脚本,支持多种主流LLM的接入,自动计算准确率并与人类专家表现对比。它解决了如何客观衡量AI在特定科学领域知识掌握程度的问题,为AI科学发现能力的评估提供了可复现的基准。项目目前处于早期阶段,代码结构清晰,但文档和扩展性有待完善。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 85
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队braingpt-lovelab
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,可自由使用和部署,无收费计划。
访问状态
是否开源是
开源协议Apache-2.0
主要语言
技术栈/模型large-language-models,neuroscience,scientific-discovery
GitHub 星标★ 85
30天Star增速
HF 下载量
上线时间2024-03-25 00:00:00
最近更新2026-09-11 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 提供标准化评测基准,可复现论文中的对比结果
  • 支持多种LLM接入,方便横向比较模型科学推理能力
  • 数据集基于真实论文,具有实际科学价值

不足之处

  • 文档较少,使用门槛较高
  • 评测领域仅限神经科学,通用性有限

适用场景

  • 评估LLM在科学领域的知识深度
  • 对比AI与人类专家的预测能力
  • 作为科学发现AI的基准测试

替代项目

SciBench、MMLU、BIG-bench

项目介绍

BrainBench 是评测安全领域的开源项目,由 braingpt-lovelab 开发,2024 年首次发布。

它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 85。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-11。Apache-2.0 许可证,可自由使用和部署,无收费计划。

它主要面向的使用场景是:评估LLM在科学领域的知识深度。同类可对比的替代方案包括 SciBench、MMLU、BIG-bench。

上一篇:ICSFSurvey

下一篇:CS-Eval

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12