PurpleLlama

给大模型装上安全护栏,评测+拦截一步到位

PurpleLlama 是 Meta 开源的一套 LLM 安全评估与加固工具集,主要解决大模型在部署前后缺乏系统化安全测试和防护手段的问题。它包含多个子项目:CyberSecEval 提供网络安全与代码安全基准,用于量化模型生成恶意代码、协助网络攻击的风险;Llama Guard 是一组输入输出内容审核模型,可对提示词和模型回复做有害内容分类;Prompt Guard 用于检测提示注入和越狱攻击;Code Shield 则在推理阶段过滤不安全的代码建议。整体覆盖从评测、检测到运行时防护的完整链路,帮助开发者在自有应用中快速搭建安全护栏,降低合规与滥用风险。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4400
维护状态 维护中
是否开源
定价模式 free

项目数据

分类评测安全
开发团队meta-llama
所属国家
官网地址
定价模式free
价格说明开源免费,无在线服务
访问状态
是否开源
开源协议NOASSERTION
主要语言Python
技术栈/模型
GitHub 星标★ 4400
30天Star增速
HF 下载量
上线时间2023-12-06 00:00:00
最近更新2026-09-17 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(项目主要开发语言为 Python)
  • 已安装 git,可访问 GitHub
  • 可访问 Hugging Face(下载 Llama Guard / Prompt Guard 等模型需账号并申请权限)

安装与启动步骤

  1. 1克隆主仓库

    把 PurpleLlama 仓库下载到本地,README 未提供具体安装命令,克隆后可查看各子项目自带文档。

    git clone https://github.com/meta-llama/PurpleLlama.git
  2. 2查看子项目结构

    进入仓库根目录查看包含哪些子项目,README 说明首发包含网络安全与输入输出防护两类工具与评测。

    cd PurpleLlama && ls -la
  3. 3了解参考集成方案

    README 的 Getting Started 指向 Llama 参考系统与 llama-recipes 仓库,安全层集成方式需到该仓库查阅。

    git clone https://github.com/meta-llama/llama-recipes.git
  4. 4获取防护模型

    Llama Guard、Prompt Guard 等模型发布在 Hugging Face 的 meta-Llama 组织页面,需登录账号按页面指引申请并下载权重。

关键配置

配置项必填说明示例
Hugging Face 访问令牌下载受限模型权重时用于身份鉴权hf_xxxxxxxxxxxxxxxxxxxx
模型本地路径加载 Llama Guard / Prompt Guard 权重时的本地目录/your/path/llama-guard

如何确认成功

README 未给出启动或测试命令,克隆完成后可用 ls 确认 CyberSecEval、Llama Guard 等子项目目录存在。

常见问题

Q:README 里没有安装命令,怎么装依赖?

A:README 仅指向 llama-recipes 与 Llama 参考系统,未给出 pip 安装步骤。需进入具体子项目目录查看其自带说明文件,按其中的依赖列表安装。

Q:怎么在应用里接入安全护栏?

A:README 说明 Llama 参考系统已集成安全层以方便部署,接入方式参考 llama-recipes 仓库中的相关示例。

Q:Llama Guard 和 Prompt Guard 模型在哪里下载?

A:在 Hugging Face 的 meta-Llama 组织页面获取,部分模型需先申请访问权限再下载权重。

注意事项

  • README 节选未提供任何 pip / docker 安装命令,本教程步骤仅为通用准备动作,具体安装请以各子项目目录内文档为准。
  • Llama Guard 等模型权重受许可约束,使用前需在 Hugging Face 页面申请并遵守相应协议。
  • 项目定位为红蓝结合的“紫色团队”思路,建议同时使用评测基准与运行时防护工具。

核心亮点

  • 提供 CyberSecEval 等可量化基准,能直接跑分对比不同模型的安全表现
  • Llama Guard、Prompt Guard 等模型可开箱即用,支持本地部署不依赖外部 API
  • 覆盖输入审核、注入检测、代码过滤多个环节,形成较完整的安全工具链

不足之处

  • 各子项目文档分散,版本与依赖关系需要自行梳理
  • 部分安全模型对中文及非英语场景的覆盖和效果缺少明确说明

适用场景

  • 企业上线 LLM 应用前做安全红队评测与合规检查
  • 聊天机器人在线拦截有害输入和越狱提示
  • 代码助手在生成阶段过滤不安全或恶意代码片段

替代项目

NeMo-Guardrails、garak

项目介绍

PurpleLlama 是一个评测安全领域的开源项目,官方简介:Set of tools to assess and improve LLM security.。项目使用 Python 开发,在 GitHub 上获得 4396 星标。

上一篇:Spiritual-Spell-Red-Teaming

下一篇:llm_benchmark

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1516 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24