trustmebro

伪造工具输出,测出模型护栏会不会被骗

TrustMeBro 是一个用 Go 编写的 LLM 安全评测工具,专门测试大模型护栏(guardrails)在伪造工具输出场景下的鲁棒性。它的核心思路是:把一段看似来自外部工具(如搜索、数据库、代码执行器)的伪造返回结果注入对话,观察模型是否会因此绕过自身的安全策略,执行本应拒绝的请求。项目解决的是安全团队在评估 LLM 应用时缺少针对性对抗样本的问题,帮助发现“模型过度信任工具输出”这一常见盲区。核心能力包括构造伪造工具调用结果、批量发送测试用例、记录模型是否被诱导越狱,以及输出可复现的评测结果。它适合红队测试、模型安全基准建设和护栏回归验证,语言为 Go,部署轻量,可作为 CI 中的安全测试环节。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 494
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队DavidCarliez
所属国家
官网地址
定价模式free
价格说明开源免费,无在线服务
访问状态
是否开源
开源协议MIT
主要语言Go
技术栈/模型
GitHub 星标★ 494
30天Star增速
HF 下载量
上线时间2026-08-26 00:00:00
最近更新2026-09-18 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

核心亮点

  • 聚焦“伪造工具输出”这一具体攻击面,比泛化的越狱测试更有针对性
  • 用 Go 实现,单二进制部署,方便集成到自动化安全评测流水线
  • 提供可复现的测试用例与结果记录,便于对比不同模型或护栏版本的鲁棒性

不足之处

  • 项目早期,测试用例覆盖面和攻击变体数量可能有限
  • 文档与社区生态尚不成熟,缺少与主流评测框架的对接示例

适用场景

  • 红队对自研 LLM 应用做上线前的护栏渗透测试
  • 安全团队在 CI 中回归验证模型升级后是否仍能抵御工具伪造攻击
  • 对比多个模型在“伪造工具输出”场景下的安全表现并输出报告

替代项目

garak、PyRIT

项目介绍

trustmebro 是一个评测安全领域的开源项目,官方简介:Bypass llm guardrails by confusing it with fabricated tool output.。项目使用 Go 开发,在 GitHub 上获得 473 星标。

上一篇:openai-guardrails-python

下一篇:pi-guardrails

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1516 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24