safelabs-eval

给 AI 智能体做红队体检,上线前先找出被越狱和注入的漏洞

safelabs-eval 是一个面向 AI 智能体的红队测试与评测框架,核心目标是把 OWASP ASI(Agentic Security Initiative)提出的安全风险清单落地成可执行的自动化测试。它针对智能体在真实任务中可能遭遇的提示注入、越狱、工具滥用、权限越界、数据泄露等问题,提供一套结构化的攻击用例与评测流程,帮助开发者在部署前发现漏洞。框架与 LangChain、CrewAI 等主流智能体编排库集成,可直接对已有 agent 发起对抗性输入并收集行为结果,输出可比较的安全评分。相比零散的手工测试,它把攻击场景、判定标准和报告流程标准化,让安全评测从一次性检查变成可回归的工程环节。项目用 Python 编写,处于早期阶段,适合安全团队和智能体开发者做上线前的风险摸底与持续监控。

开源 unknown 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 182
维护状态 活跃
是否开源
定价模式 unknown

项目数据

分类评测安全
开发团队AgentSafeLabs
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型agent-security,ai-safety,crewai,evaluation,jailbreak,langchain,llm-security,owasp,prompt-injection,red-teaming
GitHub 星标★ 182
30天Star增速
HF 下载量
上线时间2026-05-25 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-11
浏览次数0

使用教程

核心亮点

  • 对齐 OWASP ASI 风险清单,攻击用例有明确的安全分类依据,不是随意拼凑的 prompt 集合
  • 原生支持 LangChain 和 CrewAI,能直接对已有 agent 发起评测,接入成本低
  • 把红队测试流程标准化,可重复运行并对比结果,适合做安全回归测试

不足之处

  • 项目处于早期,星标约 190,攻击用例覆盖面和判定准确度仍需社区验证
  • 文档与示例相对有限,非安全背景的开发者上手可能需要额外学习成本

适用场景

  • 智能体上线前的安全验收,批量跑提示注入和越狱用例
  • 对已部署的客服/办公 agent 做定期安全回归,监控新版本是否引入漏洞
  • 安全团队评估不同 LLM 或编排框架组合下的智能体抗攻击能力

替代项目

garak、PyRIT

项目介绍

safelabs-eval 是一个评测安全领域的开源项目,官方简介:OWASP ASI-aligned red-teaming and evaluation framework for AI agents。项目使用 Python 开发,在 GitHub 上获得 190 星标。

上一篇:awesome-gpt-6-astra

下一篇:openevals

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24