deepteam

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam 是一个面向大语言模型和 AI Agent 的红队测试框架,用 Python 编写。它要解决的问题是:当企业把 LLM 或 Agent 接入真实业务后,模型可能被诱导输出有害内容、泄露系统提示词、绕过安全策略,或在多轮对话与工具调用中被越狱。DeepTeam 提供一套系统化的攻击模拟能力,内置多种攻击方式(如提示注入、越狱、角色扮演、编码混淆等),可针对不同模型、不同应用场景批量生成对抗样本并自动评估模型响应是否违规,从而在发布前发现安全短板。它支持与主流模型 API 对接,也能配合 llm-guardrails 类防护组件形成'攻击—防御'闭环,帮助安全团队、AI 工程师把红队测试从手工零散尝试变成可重复、可度量的自动化流程,降低上线后的合规与声誉风险。

开源 freemium 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2844
维护状态 较活跃
是否开源
定价模式 freemium

项目数据

分类评测安全
开发团队confident-ai
所属国家
定价模式freemium
价格说明开源框架免费,官网提供云端服务,定价信息待确认
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型llm-guardrails,llm-red-teaming,llm-safety,llm-seecurity,python
GitHub 星标★ 2844
30天Star增速
HF 下载量
上线时间2025-03-05 00:00:00
最近更新2026-09-19 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-12
浏览次数12

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • 已安装 Python 环境(README 未指定具体版本,本项目为 Python 编写)
  • 可用的 pip 包管理工具
  • 安装后需自行定义 model_callback(README 明确要求)
  • 能访问外网以下载 PyPI 依赖与查阅官网文档

安装与启动步骤

  1. 1检查Python环境

    确认本机已装 Python 与 pip,Python 版本要求 README 未明确,建议使用较新的 Python 3。

    python --version
  2. 2安装deepteam

    README 给出的唯一安装命令,-U 表示升级到最新版本;建议先创建虚拟环境隔离依赖。

    pip install -U deepteam
  3. 3验证安装成功

    尝试导入 deepteam 包,无报错即说明包已正确安装到当前 Python 环境。

    python -c "import deepteam"
  4. 4定义model_callback

    README 强调:不需要先声明被测试的 LLM 系统,但必须定义 model_callback 把攻击样本送进模型。README 节选未给代码示例。

  5. 5查阅官方文档

    README 的 QuickStart 之外还需要攻击、漏洞等具体用法,请以官网文档为准,README 节选未包含完整代码。

如何确认成功

执行 python -c "import deepteam" 不报 ModuleNotFoundError,即表示安装成功,可再按官网文档接入 model_callback 验证。

常见问题

Q:使用前必须先定义被测试的 LLM 系统吗?

A:不需要。README 明确说明 DeepTeam 不要求你定义正在红队测试的 LLM 系统,只需安装 deepteam 并定义一个 model_callback 即可开始。

Q:安装完就能直接跑红队测试吗?

A:还需要自己编写 model_callback 等调用代码。README 节选只提供了安装命令与概念说明,完整可运行示例请查阅官网文档 trydeepteam.com。

Q:要测试哪些风险项、用哪些攻击方式?

A:README 提到内置提示注入、越狱、角色扮演、编码混淆等攻击方式,以及漏洞与功能章节,具体配置需参考官网文档的相应章节。

注意事项

  • README 节选仅包含 pip install -U deepteam 一条安装命令,其余用法(含 model_callback 写法)以官网文档为准,不要自行猜测参数。
  • 建议在虚拟环境(venv/conda)中安装,避免与现有项目的依赖版本冲突。
  • 该项目可用于在发布前发现 LLM/Agent 的安全短板,并可配合 llm-guardrails 类防护组件形成攻防闭环。
  • 对真实业务模型做红队测试前,请确认已获得授权并遵守目标模型服务的使用条款。

核心亮点

  • 内置多种攻击策略(提示注入、越狱、编码混淆等),开箱即可对模型批量发起红队测试
  • 提供自动化评估流程,能对模型响应是否违规打分,减少人工逐条审核成本
  • 面向 LLM 与 AI Agent 双场景,支持多轮对话和工具调用类应用的对抗测试

不足之处

  • 攻击用例和评估指标的覆盖面仍在演进,复杂业务场景可能需要自行扩展
  • 作为成长中项目,中文文档与社区案例相对有限,上手依赖英文资料

适用场景

  • 大模型应用上线前的安全合规自查
  • AI Agent 工具调用链路的安全渗透测试
  • 安全团队对自研模型做定期红队演练

替代项目

garak、PyRIT、promptfoo

项目介绍

deepteam 是评测安全领域的开源项目,由 confident-ai 开发,2025 年首次发布。

在全站 12,822 个收录项目中,它的 GitHub 星标数(2,844)位列前 30%,在评测安全分类的 451 个项目里位列前 10%。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-19。开源框架免费,官网提供云端服务。从国内网络环境看,可直接访问。

它主要面向的使用场景是:大模型应用上线前的安全合规自查。同类可对比的替代方案包括 garak、PyRIT、promptfoo。

上一篇:AI-Surface

下一篇:agent-scan

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1354 2026-08-24