
Spiritual-Spell-Red-Teaming
用现成越狱提示快速测出大模型安全漏洞
Spiritual-Spell-Red-Teaming 是一个专注于大语言模型越狱(jailbreak)测试的开源仓库,主要针对 Claude 系列模型,也覆盖其他 LLM。它收集并整理了大量提示词攻击模板、角色扮演框架和绕过安全对齐的技巧,帮助安全研究人员、红队成员和 AI 产品团队评估模型在恶意诱导下的行为边界。核心能力包括:提供可直接复用的越狱提示样例、按攻击类型分类的测试用例、针对 Claude 的特定绕过策略,以及社区提交的新攻击手法。项目本身不训练模型,而是作为对抗性测试的“弹药库”,让使用者快速验证目标模型的安全防护是否牢固,发现潜在的内容过滤漏洞或策略绕过路径,从而推动模型安全对齐的改进。
项目数据
使用教程
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
环境要求
- 本地已安装 git(用于克隆仓库)
- 可正常访问 GitHub 的网络环境
- 准备好被测模型的对话入口或 API Key(如 sk-xxxxxxxx)
- 仅限获得授权的红队/安全评估场景
安装与启动步骤
-
1克隆仓库
把仓库下载到本地。README 节选中未提供任何安装脚本或依赖说明,克隆是唯一可确定的操作。
git clone https://github.com/Goochbeater/Spiritual-Spell-Red-Teaming.git -
2进入仓库目录
切换到仓库根目录,用文件管理器或编辑器浏览其中的提示词与分类文件。
cd Spiritual-Spell-Red-Teaming -
3筛选测试用例
按攻击类型挑选可复用的越狱提示模板,注意区分针对 Claude 与其他 LLM 的绕过策略。
-
4在被测模型上验证
把选中的提示词粘贴到目标模型对话中,观察是否被拦截、拒答或成功绕过安全对齐。
-
5记录并归档结果
保存提示词原文、模型名称与版本、响应内容,便于横向对比不同模型的安全防护强度。
如何确认成功
克隆完成后能在本地目录中列出仓库内的提示词与说明文件,即表示准备就绪。
常见问题
Q:README 里没有安装说明怎么办?
A:该仓库是提示词与测试用例集合,本身不训练模型也不提供安装脚本,克隆后直接阅读和使用其中的文本内容即可。
Q:需要 pip install 或 Docker 吗?
A:不需要。README 节选中未出现任何依赖、端口或容器相关内容,仓库以提示词模板和攻击手法整理为主。
Q:可以直接对 Claude 使用这些提示词吗?
A:仅可在你获得授权的测试环境中使用,并须遵守目标服务的条款与当地法律法规,不得用于攻击生产环境或绕过线上安全策略。
Q:README 内容显示为空白或乱码怎么办?
A:README 中夹带了大量不可见的 Unicode 变体选择符,建议换用支持 Unicode 的编辑器打开,或直接查看仓库内的其他文件。
注意事项
- 仓库定位是大模型红队对抗测试的“弹药库”,请仅用于授权范围内的大模型安全评估。
- README 节选内容被不可见字符混淆,部分说明难以阅读,实际情况请以仓库文件为准。
- 本次教程未给出安装或运行命令,因为 README 节选中确实没有相关信息。
- 越狱效果受模型版本和策略更新影响,建议记录每次测试的时间与模型版本。
核心亮点
- 专门针对 Claude 的越狱提示集合,攻击样例具体可复用
- 覆盖多种攻击类型,便于系统性红队测试
- 社区活跃,星标增长快,持续有新手法提交
不足之处
- 仓库以提示词文本为主,缺少自动化测试脚本和评估指标
- 文档和分类说明较简略,新手需自行摸索使用方式
适用场景
- AI 安全团队对 Claude 等模型做红队对抗测试
- 研究人员分析大模型安全对齐的薄弱环节
- 开发者在上线前评估自家 LLM 应用的内容过滤强度
替代项目
llm-attacks、garak、PyRIT
项目介绍
上一篇:LLM4Pentest
下一篇:PurpleLlama
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents