rebuff

给 LLM 应用加装防注入安全层,拦截恶意提示词

Rebuff 是一个专注于检测和防御大语言模型提示注入攻击的开源工具。它解决的是 LLM 应用面临的安全问题,即恶意用户通过精心构造的输入提示,诱导模型执行非预期操作或泄露敏感信息。Rebuff 提供多层次的防护能力,包括基于正则表达式的模式匹配、基于 OpenAI 的语义检测、基于提示词攻击的诱饵检测,以及通过外部 API 进行内容审核。其核心能力是构建一个可插拔的防护层,开发者可以轻松集成到现有 LLM 应用中,在用户输入进入模型前进行多层扫描,识别并阻断潜在的注入攻击。项目采用 TypeScript 编写,提供了清晰的 API 和配置选项,适合需要快速增强 LLM 应用安全性的开发者使用。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1520
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队protectai
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言TypeScript
技术栈/模型llm,llmops,prompt-engineering,prompt-injection,prompts,security
GitHub 星标★ 1520
30天Star增速
HF 下载量
上线时间2023-04-24 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • 已安装 Python 与 pip(README 未指定具体版本)
  • 可正常访问 PyPI 的网络环境
  • 如需服务端部署,需参考官方 Self-hosting 与 docs.rebuff.ai 文档

安装与启动步骤

  1. 1确认 Python 环境

    先确认本机已具备 Python 与 pip,后续安装命令依赖 pip,README 未指定最低版本。

    python --version
    pip --version
  2. 2安装 rebuff

    使用 README 给出的官方命令从 PyPI 安装 rebuff 包,建议在虚拟环境中执行以免污染全局环境。

    pip install rebuff
  3. 3配置服务端参数

    服务端配置项 BILLING_RATE_INT_10K 决定每次请求扣除的额度,按 10k 对应 1 美元换算后设置。

    export BILLING_RATE_INT_10K=10000
  4. 4验证安装结果

    尝试导入 rebuff 模块,确认依赖已正确安装且无导入错误。

    python -c "import rebuff"
  5. 5查阅进阶文档

    README 中的 Getting started / Self-hosting 仅给出入口,具体 API 调用与自托管步骤请查看官方文档。

关键配置

配置项必填说明示例
BILLING_RATE_INT_10K是每次请求扣除的额度,10k 对应 1 美元;设为 1 即每次请求扣 0.1 美分10000

如何确认成功

执行 python -c "import rebuff" 无报错,即表示依赖安装成功。

常见问题

Q:Rebuff 能提供 100% 的提示注入防护吗?

A:不能。README 的 Disclaimer 明确说明 Rebuff 仍是原型,无法提供 100% 的保护,建议作为多层防御中的一环使用。

Q:有 Python SDK 吗?

A:README 路线图中 Prompt Injection Detection、Canary Word Leak Detection、Attack Signature Learning、JavaScript/TypeScript SDK 均已完成,Python SDK 仍待完成。

Q:BILLING_RATE_INT_10K 该怎么取值?

A:该值为整数,10000 表示每次请求扣 1 美元,设为 1 表示每次请求扣 0.1 美分,可按业务成本自行调整。

Q:安装命令是什么?

A:README 给出的安装方式只有一条:pip install rebuff,无需其他前置依赖安装步骤。

注意事项

  • Rebuff 仍是原型,官方明确声明无法 100% 防御提示注入攻击。
  • README 未给出 API Key、端口、服务地址等配置,实际接入前请先阅读 docs.rebuff.ai。
  • Rebuff 采用四层防御:启发式规则、基于 LLM 的检测、向量数据库存储历史攻击、Canary Token 泄露检测。
  • 官方提供在线 Playground(playground.rebuff.ai)可用于快速体验效果。

核心亮点

  • 多层检测机制(正则、语义、诱饵、审核),防护更全面
  • 提供可插拔的 SDK,易于集成到现有 LLM 应用
  • 支持自定义检测规则,灵活适配不同场景

不足之处

  • 依赖外部 API(如 OpenAI)可能增加成本和延迟
  • 检测存在误报/漏报风险,需结合业务调优
  • 文档/社区待观察

适用场景

  • 构建面向公众的聊天机器人或客服系统,防止恶意指令注入
  • 在 RAG 或 Agent 应用中,过滤外部知识库中的恶意内容
  • 作为安全中间件,为内部 LLM 工具提供统一输入防护

替代项目

Prompt Guard、Llama Guard、NeMo Guardrails

项目介绍

rebuff 是评测安全领域的开源项目,由 protectai 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,520)位列前 30%,在评测安全分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0 许可证,可免费使用和部署。

它主要面向的使用场景是:构建面向公众的聊天机器人或客服系统,防止恶意指令注入。同类可对比的替代方案包括 Prompt Guard、Llama Guard、NeMo Guardrails。

上一篇:FuzzyAI

下一篇:llm-colosseum

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12