BrainBench 是评测安全领域的开源项目,由 braingpt-lovelab 开发,2024 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 85。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-11。Apache-2.0 许可证,可自由使用和部署,无收费计划。
它主要面向的使用场景是:评估LLM在科学领域的知识深度。同类可对比的替代方案包括 SciBench、MMLU、BIG-bench。

用神经科学实验预测题,测出AI比专家更懂科研
BrainBench 是论文《Large language models surpass human experts in predicting neuroscience results》的官方开源代码库,旨在评估和比较大型语言模型(LLM)与人类神经科学专家在预测实验结果方面的能力。该工具通过构建结构化的神经科学实验描述(包括背景、方法、结果等),让模型和专家分别预测实验的统计显著性结果,从而量化模型的科学推理水平。核心能力包括:提供标准化的评测数据集和评估脚本,支持多种主流LLM的接入,自动计算准确率并与人类专家表现对比。它解决了如何客观衡量AI在特定科学领域知识掌握程度的问题,为AI科学发现能力的评估提供了可复现的基准。项目目前处于早期阶段,代码结构清晰,但文档和扩展性有待完善。
SciBench、MMLU、BIG-bench
BrainBench 是评测安全领域的开源项目,由 braingpt-lovelab 开发,2024 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 85。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-11。Apache-2.0 许可证,可自由使用和部署,无收费计划。
它主要面向的使用场景是:评估LLM在科学领域的知识深度。同类可对比的替代方案包括 SciBench、MMLU、BIG-bench。
上一篇:ICSFSurvey
下一篇:CS-Eval
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.