inspect_ai

统一跑大模型评测,结果可复现可回放

Inspect 是英国人工智能安全研究所(UK AISI)开源的大模型评测框架,用 Python 编写,目标是让开发者用统一、可复现的方式评测大语言模型的各项能力与安全表现。它解决的核心问题是:模型评测往往散落在临时脚本里,难以复用、对比和审计。Inspect 提供任务(Task)、求解器(Solver)、评分器(Scorer)三层抽象,把数据集、提示词、模型调用和打分逻辑组合成可配置的评测流程,支持多轮对话、工具调用、沙箱执行和人工审核等多种模式。框架内置日志查看器,可回放每次评测的完整轨迹,便于定位模型失败原因。它既适合跑学术基准,也适合做安全红队测试,还能接入自定义数据集和第三方模型接口,输出结构化结果用于横向对比。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2799
维护状态 活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队UKGovernmentBEIS
所属国家
定价模式free
价格说明开源免费框架,官网提供文档与在线使用入口
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型
GitHub 星标★ 2799
30天Star增速
HF 下载量
上线时间2023-11-14 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 5 步

环境要求

  • Python 环境(README 未指定具体版本)
  • pip,用于安装依赖包
  • git,用于克隆仓库
  • 可选:uv,README 提到可用它同步开发环境

安装与启动步骤

  1. 1克隆仓库

    从 GitHub 拉取 Inspect 源码到本地,README 给出的官方仓库地址如下。

    git clone https://github.com/UKGovernmentBEIS/inspect_ai.git
  2. 2进入项目目录

    切换到刚克隆下来的 inspect_ai 目录,后续安装命令都在此目录执行。

    cd inspect_ai
  3. 3安装开发依赖

    用 -e 可编辑模式安装,并附带 [dev] 可选依赖;引号要保留,避免被 shell 解析。

    pip install -e ".[dev]"
  4. 4阅读官方文档

    README 未给出更多安装细节,入门用法请直接查阅官网文档首页。

  5. 5挑选预置评测

    Inspect 内置 200 多个可直接运行的评测任务,可先浏览评测目录再决定跑哪个。

如何确认成功

安装过程无报错即完成开发环境搭建;随后按官方文档 https://inspect.aisi.org.uk/ 的指引运行评测,确认可正常调用。

常见问题

Q:应该用 pip 还是 uv 安装?

A:README 给出的方式是 pip install -e ".[dev]";同时提到如果使用 uv,也可以用它同步开发环境。两者择一即可,uv 部分说明在 README 中被截断。

Q:有现成的评测可以直接跑吗?

A:有。Inspect 提供 200 多个预置评测,可运行在任意模型上,详情见 https://inspect.aisi.org.uk/evals/。

Q:文档在哪里看?

A:官网 https://inspect.aisi.org.uk/。另提供结构化索引 llms.txt、合并版用户指南 llms-guide.txt 和含 API/CLI 的 llms-full.txt。

Q:为什么安装命令要加 -e 和 [dev]?

A:-e 是可在本地直接改代码生效的可编辑安装,[dev] 会额外装上开发所需的可选依赖,适合参与框架开发。

注意事项

  • README 展示的是开发者安装流程,普通用户使用方式请以官方文档为准。
  • 命令中的 ".[dev]" 建议保留双引号,防止 shell 把方括号当通配符处理。
  • 官方文档页面在 .html 路径后追加 .md 即可获得 Markdown 版本,例如 /extensions/index.html.md。
  • 扩展 Inspect 的组件(如新的提问与评分方式)以独立 Python 包形式提供。

核心亮点

  • Task/Solver/Scorer 三层抽象清晰,评测流程可组合复用,不是一次性脚本
  • 自带日志查看器,能回放每次对话与工具调用轨迹,方便定位模型失败原因
  • 由英国 AI 安全研究所主导,安全评测与红队场景支持较完整,支持沙箱执行

不足之处

  • 生态与文档仍在成长期,第三方模型和数据集适配需要自己动手的部分较多
  • 偏重评测流程编排,开箱即用的现成基准集合不如部分老牌评测库丰富

适用场景

  • 团队搭建可复现的大模型能力基准,横向对比多个模型版本
  • 安全团队对大模型做红队测试,记录并回放危险输出与工具调用
  • 研究者把自定义数据集和评分逻辑接入统一框架,产出可审计的评测报告

替代项目

lm-evaluation-harness、promptfoo、OpenAI Evals

项目介绍

inspect_ai 是一个评测安全领域的开源项目,官方简介:Inspect: A framework for large language model evaluations。项目使用 Python 开发,在 GitHub 上获得 2771 星标。

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1516 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24