
safelabs-eval
给 AI 智能体做红队体检,上线前先找出被越狱和注入的漏洞
safelabs-eval 是一个面向 AI 智能体的红队测试与评测框架,核心目标是把 OWASP ASI(Agentic Security Initiative)提出的安全风险清单落地成可执行的自动化测试。它针对智能体在真实任务中可能遭遇的提示注入、越狱、工具滥用、权限越界、数据泄露等问题,提供一套结构化的攻击用例与评测流程,帮助开发者在部署前发现漏洞。框架与 LangChain、CrewAI 等主流智能体编排库集成,可直接对已有 agent 发起对抗性输入并收集行为结果,输出可比较的安全评分。相比零散的手工测试,它把攻击场景、判定标准和报告流程标准化,让安全评测从一次性检查变成可回归的工程环节。项目用 Python 编写,处于早期阶段,适合安全团队和智能体开发者做上线前的风险摸底与持续监控。
项目数据
使用教程
核心亮点
- 对齐 OWASP ASI 风险清单,攻击用例有明确的安全分类依据,不是随意拼凑的 prompt 集合
- 原生支持 LangChain 和 CrewAI,能直接对已有 agent 发起评测,接入成本低
- 把红队测试流程标准化,可重复运行并对比结果,适合做安全回归测试
不足之处
- 项目处于早期,星标约 190,攻击用例覆盖面和判定准确度仍需社区验证
- 文档与示例相对有限,非安全背景的开发者上手可能需要额外学习成本
适用场景
- 智能体上线前的安全验收,批量跑提示注入和越狱用例
- 对已部署的客服/办公 agent 做定期安全回归,监控新版本是否引入漏洞
- 安全团队评估不同 LLM 或编排框架组合下的智能体抗攻击能力
替代项目
garak、PyRIT
项目介绍
下一篇:openevals
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents