
PurpleLlama
给大模型装上安全护栏,评测+拦截一步到位
PurpleLlama 是 Meta 开源的一套 LLM 安全评估与加固工具集,主要解决大模型在部署前后缺乏系统化安全测试和防护手段的问题。它包含多个子项目:CyberSecEval 提供网络安全与代码安全基准,用于量化模型生成恶意代码、协助网络攻击的风险;Llama Guard 是一组输入输出内容审核模型,可对提示词和模型回复做有害内容分类;Prompt Guard 用于检测提示注入和越狱攻击;Code Shield 则在推理阶段过滤不安全的代码建议。整体覆盖从评测、检测到运行时防护的完整链路,帮助开发者在自有应用中快速搭建安全护栏,降低合规与滥用风险。
项目数据
使用教程
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
环境要求
- Python 环境(项目主要开发语言为 Python)
- 已安装 git,可访问 GitHub
- 可访问 Hugging Face(下载 Llama Guard / Prompt Guard 等模型需账号并申请权限)
安装与启动步骤
-
1克隆主仓库
把 PurpleLlama 仓库下载到本地,README 未提供具体安装命令,克隆后可查看各子项目自带文档。
git clone https://github.com/meta-llama/PurpleLlama.git -
2查看子项目结构
进入仓库根目录查看包含哪些子项目,README 说明首发包含网络安全与输入输出防护两类工具与评测。
cd PurpleLlama && ls -la -
3了解参考集成方案
README 的 Getting Started 指向 Llama 参考系统与 llama-recipes 仓库,安全层集成方式需到该仓库查阅。
git clone https://github.com/meta-llama/llama-recipes.git -
4获取防护模型
Llama Guard、Prompt Guard 等模型发布在 Hugging Face 的 meta-Llama 组织页面,需登录账号按页面指引申请并下载权重。
关键配置
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
Hugging Face 访问令牌 | 是 | 下载受限模型权重时用于身份鉴权 | hf_xxxxxxxxxxxxxxxxxxxx |
模型本地路径 | 否 | 加载 Llama Guard / Prompt Guard 权重时的本地目录 | /your/path/llama-guard |
如何确认成功
README 未给出启动或测试命令,克隆完成后可用 ls 确认 CyberSecEval、Llama Guard 等子项目目录存在。
常见问题
Q:README 里没有安装命令,怎么装依赖?
A:README 仅指向 llama-recipes 与 Llama 参考系统,未给出 pip 安装步骤。需进入具体子项目目录查看其自带说明文件,按其中的依赖列表安装。
Q:怎么在应用里接入安全护栏?
A:README 说明 Llama 参考系统已集成安全层以方便部署,接入方式参考 llama-recipes 仓库中的相关示例。
Q:Llama Guard 和 Prompt Guard 模型在哪里下载?
A:在 Hugging Face 的 meta-Llama 组织页面获取,部分模型需先申请访问权限再下载权重。
注意事项
- README 节选未提供任何 pip / docker 安装命令,本教程步骤仅为通用准备动作,具体安装请以各子项目目录内文档为准。
- Llama Guard 等模型权重受许可约束,使用前需在 Hugging Face 页面申请并遵守相应协议。
- 项目定位为红蓝结合的“紫色团队”思路,建议同时使用评测基准与运行时防护工具。
核心亮点
- 提供 CyberSecEval 等可量化基准,能直接跑分对比不同模型的安全表现
- Llama Guard、Prompt Guard 等模型可开箱即用,支持本地部署不依赖外部 API
- 覆盖输入审核、注入检测、代码过滤多个环节,形成较完整的安全工具链
不足之处
- 各子项目文档分散,版本与依赖关系需要自行梳理
- 部分安全模型对中文及非英语场景的覆盖和效果缺少明确说明
适用场景
- 企业上线 LLM 应用前做安全红队评测与合规检查
- 聊天机器人在线拦截有害输入和越狱提示
- 代码助手在生成阶段过滤不安全或恶意代码片段
替代项目
NeMo-Guardrails、garak
项目介绍
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents