jailbreak
本站收录 29 个带「jailbreak」标签的 AI 开源项目
L1B3RT4SL1B3RT4S 是一个以幽默和反讽方式呈现的提示词集合项目,旨在通过戏仿“越狱”提示词的形式,展示 AI 提示词工程的边界与可能性。它收集了大量看似“解放”A★ 21,585
ChatGPT_DANChatGPT_DAN 是一个专门收集和分享 ChatGPT 越狱提示词(Jailbreak prompts)的开源项目,核心是让 ChatGPT 突破官方限制★ 12,517
BlackFriday-GPTs-Prompts这是一个收集无需 ChatGPT Plus 订阅即可免费使用的 GPTs 提示词列表。它解决用户因付费墙而无法体验高级 GPTs 功能的问题,核心能力是整理并分★ 9,787
jailbreak_llmsjailbreak_llms 是一个专注于大语言模型越狱攻击的数据集项目,收录了来自 Reddit、Discord、网站及开源数据集的 15,140 条 Cha★ 3,826
Awesome-LM-SSPAwesome-LM-SSP 是一个聚焦大模型安全、隐私与可信度的精选阅读清单,收录了相关论文、工具、数据集和攻击防御方法。它系统梳理了提示注入、越狱攻击、隐私★ 2,081
Awesome-Jailbreak-on-LLMs这是一个聚焦大语言模型越狱攻击方法的精选资源库,系统整理了学术界和工业界关于LLM安全漏洞的最新研究。项目收集了论文、代码、数据集、评估工具和分析报告,覆盖从提★ 1,659
FuzzyAIFuzzyAI 是一个自动化的大语言模型模糊测试工具,旨在帮助开发者和安全研究人员发现并缓解其 LLM API 中的潜在越狱漏洞。它通过生成大量恶意或边界输入,★ 1,580
awesome-chatgpt-code-interpreter-experiments这是一个精选资源列表,汇集了 ChatGPT 结合 Code Interpreter(代码解释器)功能的创意实验和实用案例。它解决了用户不知道如何充分利用代码解★ 1,014
gpt_jailbreak_status这是一个追踪 OpenAI GPT 语言模型越狱状态的开源项目,旨在实时更新 GPT 系列模型(如 ChatGPT)被越狱(即绕过安全限制)的进展。项目以 HT★ 933
EasyJailbreakEasyJailbreak 是一个易用的 Python 框架,用于生成对抗性越狱提示词,以评估和提升大语言模型的安全性。它解决了安全研究人员在构造越狱攻击时缺乏★ 914
SydneyQtSydneyQt 是一个跨平台的桌面客户端,用于接入被越狱的 New Bing AI Copilot(即 Sydney 版本),基于 Go 和 Wails 构建★ 876
hanshuang-codexhanshuang-codex 是一个用 Python 编写的开源实验项目,主要针对 GPT 6.0 与 workbuddyV4.1flash 等大模型开展“破★ 811
CipherChatCipherChat是一个评估大语言模型安全对齐泛化能力的框架。它通过将有害指令编码为密码或加密形式,测试模型在非自然语言输入下的安全表现。核心能力包括:支持多★ 630
agent-opforagent-opfor 是一个开源的 AI 智能体对抗模拟工具,专注于对 AI 智能体和 MCP 服务器进行红队测试。它解决了 AI 应用在部署前缺乏系统性安全★ 582
hackagentHackAgent 是一个开源的 AI 智能体安全检测工具包,专门用于发现和验证 AI Agent 的漏洞。它主要解决大语言模型驱动的智能体在真实应用场景中面临★ 520
ZORG-Jailbreak-Prompt-TextZORG-Jailbreak-Prompt-Text 是一个专注于 AI 对话越狱提示词的开源项目,旨在帮助用户绕过 ChatGPT、Gemini、DeepSe★ 310
llamatorllamator 是一个用于测试聊天机器人和生成式 AI 系统的红队(Red Teaming)Python 框架。它主要解决 LLM 应用在安全性和可靠性方面的★ 223
safelabs-evalsafelabs-eval 是一个面向 AI 智能体的红队测试与评测框架,核心目标是把 OWASP ASI(Agentic Security Initiativ★ 220
HacxGPT-Jailbreak-promptsHacxGPT-Jailbreak-prompts 是一个专门收集和分享 AI 模型越狱提示词(Jailbreak prompts)的开源项目,旨在解锁 Cha★ 209
ChatGPT-Jailbreak-ProChatGPT-Jailbreak-Pro 是一个开源的 ChatGPT 越狱工具,旨在通过精心设计的提示词(prompts)绕过 ChatGPT 的内容限制,★ 190
Jailbreak-FoundryJailbreak-Foundry 是一个将越狱研究论文转化为可运行攻击与基准测试的系统,旨在解决 AI 安全研究中论文复现难、基准不统一的问题。它能够从论文中★ 170
Awesome-LLMSecOpsAwesome-LLMSecOps 是一个专注于大语言模型(LLM)与智能体(Agent)安全运营的精选资源列表。它系统性地整理了 LLM 安全领域的威胁建模、★ 161
Awesome-Embodied-AI-Safety这是一个关于具身AI安全领域的综述性开源项目,汇集了500多篇相关论文,系统梳理了具身AI在感知、认知、规划、交互和智能体系统等层面面临的风险、攻击与防御方法。★ 144
autoguardrailsAutoGuardrails 是一个面向 LLM 护栏的 alignment-research 脚手架,采用 autoresearch 风格,在单一的 poli★ 130
chatbot-experiments这是一个存放 ChatGPT/Bing Chat 越狱提示词、实验性 Prompt 及实用工具的仓库,旨在收集和分享绕过 AI 聊天机器人安全限制的尝试与结果。★ 128
Rules.txtRules.txt 是一个针对大型语言模型(LLM)的对齐与越狱(jailbreak)研究项目,提供一套指令集,用于审计模型内部推理过程并揭示潜在偏见。它通过精★ 105
Spectral-DeTuningSpectral-DeTuning 是 ICML 2024 论文的官方 PyTorch 实现,旨在恢复生成模型在微调前的原始权重。它解决了当模型(如 Stabl★ 86
circle-guard-benchcircle-guard-bench 是首个专门评估大语言模型(LLM)防护系统(包括 guardrails 和 safeguards)能力的 AI 基准测试框★ 81
awesome-ai-agents-security这是一个关于AI智能体安全的精选资源列表,旨在绘制AI代理安全生态系统的活地图。它系统整理了该领域的关键主题,包括自主代理、生成式AI、网络安全、护栏、越狱攻击★ 73