inspect_evals

一行命令跑齐大模型能力与安全评测

inspect_evals 是英国 AI 安全研究院(UK AISI)为 Inspect AI 框架提供的官方评测集合,解决大模型能力与安全评估中任务分散、标准不一的问题。它把数学推理、代码生成、智能体行为、网络安全、偏见与有害内容等领域的评测统一成可复用的 Python 任务,开发者只需一行命令即可在本地或集群上运行,并自动生成结构化日志与可视化报告。核心能力包括:覆盖学术基准与真实安全场景的多样化任务、支持模型对比与消融实验、可自定义数据集和评分器、与 Inspect 的沙箱和工具调用机制无缝集成。项目处于早期但迭代活跃,适合需要系统化评估模型安全与能力的团队作为基准工具。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 675
维护状态 活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队UKGovernmentBEIS
所属国家
定价模式free
价格说明开源免费,MIT 许可证
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型
GitHub 星标★ 675
30天Star增速
HF 下载量
上线时间2024-10-02 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-14
浏览次数0

使用教程

核心亮点

  • 由 UK AISI 官方维护,评测任务设计贴合真实安全场景,可信度高
  • 与 Inspect AI 深度集成,支持沙箱、工具调用和结构化日志,扩展新评测成本低
  • 覆盖数学、代码、智能体、网络安全、偏见等多领域,可横向对比模型表现

不足之处

  • 项目仍处早期,部分评测任务和文档尚不完整,API 可能变动
  • 依赖 Inspect AI 生态,单独使用或迁移到其他评测框架不够方便

适用场景

  • 模型发布前做安全与能力回归测试
  • 研究团队对比不同模型在智能体和代码任务上的表现
  • 企业搭建内部大模型评测流水线并生成审计报告

替代项目

lm-evaluation-harness、HELM

项目介绍

inspect_evals 是一个评测安全领域的开源项目,官方简介:Collection of evals for Inspect AI。项目使用 Python 开发,在 GitHub 上获得 669 星标。

上一篇:evals

下一篇:evals-skills

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24