
trustmebro
伪造工具输出,测出模型护栏会不会被骗
TrustMeBro 是一个用 Go 编写的 LLM 安全评测工具,专门测试大模型护栏(guardrails)在伪造工具输出场景下的鲁棒性。它的核心思路是:把一段看似来自外部工具(如搜索、数据库、代码执行器)的伪造返回结果注入对话,观察模型是否会因此绕过自身的安全策略,执行本应拒绝的请求。项目解决的是安全团队在评估 LLM 应用时缺少针对性对抗样本的问题,帮助发现“模型过度信任工具输出”这一常见盲区。核心能力包括构造伪造工具调用结果、批量发送测试用例、记录模型是否被诱导越狱,以及输出可复现的评测结果。它适合红队测试、模型安全基准建设和护栏回归验证,语言为 Go,部署轻量,可作为 CI 中的安全测试环节。
开源
free
评测安全
GitHub 星标
★ 494
维护状态
较活跃
是否开源
是
定价模式
free
项目数据
分类评测安全
开发团队DavidCarliez
所属国家
定价模式free
价格说明开源免费,无在线服务
访问状态
是否开源是
开源协议MIT
主要语言Go
技术栈/模型
GitHub 星标★ 494
30天Star增速
HF 下载量
上线时间2026-08-26 00:00:00
最近更新2026-09-18 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0
使用教程
核心亮点
- 聚焦“伪造工具输出”这一具体攻击面,比泛化的越狱测试更有针对性
- 用 Go 实现,单二进制部署,方便集成到自动化安全评测流水线
- 提供可复现的测试用例与结果记录,便于对比不同模型或护栏版本的鲁棒性
不足之处
- 项目早期,测试用例覆盖面和攻击变体数量可能有限
- 文档与社区生态尚不成熟,缺少与主流评测框架的对接示例
适用场景
- 红队对自研 LLM 应用做上线前的护栏渗透测试
- 安全团队在 CI 中回归验证模型升级后是否仍能抵御工具伪造攻击
- 对比多个模型在“伪造工具输出”场景下的安全表现并输出报告
替代项目
garak、PyRIT
项目介绍
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents