
inspect_ai
统一跑大模型评测,结果可复现可回放
Inspect 是英国人工智能安全研究所(UK AISI)开源的大模型评测框架,用 Python 编写,目标是让开发者用统一、可复现的方式评测大语言模型的各项能力与安全表现。它解决的核心问题是:模型评测往往散落在临时脚本里,难以复用、对比和审计。Inspect 提供任务(Task)、求解器(Solver)、评分器(Scorer)三层抽象,把数据集、提示词、模型调用和打分逻辑组合成可配置的评测流程,支持多轮对话、工具调用、沙箱执行和人工审核等多种模式。框架内置日志查看器,可回放每次评测的完整轨迹,便于定位模型失败原因。它既适合跑学术基准,也适合做安全红队测试,还能接入自定义数据集和第三方模型接口,输出结构化结果用于横向对比。
项目数据
使用教程
环境要求
- Python 环境(README 未指定具体版本)
- pip,用于安装依赖包
- git,用于克隆仓库
- 可选:uv,README 提到可用它同步开发环境
安装与启动步骤
-
1克隆仓库
从 GitHub 拉取 Inspect 源码到本地,README 给出的官方仓库地址如下。
git clone https://github.com/UKGovernmentBEIS/inspect_ai.git -
2进入项目目录
切换到刚克隆下来的 inspect_ai 目录,后续安装命令都在此目录执行。
cd inspect_ai -
3安装开发依赖
用 -e 可编辑模式安装,并附带 [dev] 可选依赖;引号要保留,避免被 shell 解析。
pip install -e ".[dev]" -
4阅读官方文档
README 未给出更多安装细节,入门用法请直接查阅官网文档首页。
-
5挑选预置评测
Inspect 内置 200 多个可直接运行的评测任务,可先浏览评测目录再决定跑哪个。
如何确认成功
安装过程无报错即完成开发环境搭建;随后按官方文档 https://inspect.aisi.org.uk/ 的指引运行评测,确认可正常调用。
常见问题
Q:应该用 pip 还是 uv 安装?
A:README 给出的方式是 pip install -e ".[dev]";同时提到如果使用 uv,也可以用它同步开发环境。两者择一即可,uv 部分说明在 README 中被截断。
Q:有现成的评测可以直接跑吗?
A:有。Inspect 提供 200 多个预置评测,可运行在任意模型上,详情见 https://inspect.aisi.org.uk/evals/。
Q:文档在哪里看?
A:官网 https://inspect.aisi.org.uk/。另提供结构化索引 llms.txt、合并版用户指南 llms-guide.txt 和含 API/CLI 的 llms-full.txt。
Q:为什么安装命令要加 -e 和 [dev]?
A:-e 是可在本地直接改代码生效的可编辑安装,[dev] 会额外装上开发所需的可选依赖,适合参与框架开发。
注意事项
- README 展示的是开发者安装流程,普通用户使用方式请以官方文档为准。
- 命令中的 ".[dev]" 建议保留双引号,防止 shell 把方括号当通配符处理。
- 官方文档页面在 .html 路径后追加 .md 即可获得 Markdown 版本,例如 /extensions/index.html.md。
- 扩展 Inspect 的组件(如新的提问与评分方式)以独立 Python 包形式提供。
核心亮点
- Task/Solver/Scorer 三层抽象清晰,评测流程可组合复用,不是一次性脚本
- 自带日志查看器,能回放每次对话与工具调用轨迹,方便定位模型失败原因
- 由英国 AI 安全研究所主导,安全评测与红队场景支持较完整,支持沙箱执行
不足之处
- 生态与文档仍在成长期,第三方模型和数据集适配需要自己动手的部分较多
- 偏重评测流程编排,开箱即用的现成基准集合不如部分老牌评测库丰富
适用场景
- 团队搭建可复现的大模型能力基准,横向对比多个模型版本
- 安全团队对大模型做红队测试,记录并回放危险输出与工具调用
- 研究者把自定义数据集和评分逻辑接入统一框架,产出可审计的评测报告
替代项目
lm-evaluation-harness、promptfoo、OpenAI Evals
项目介绍
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents