prompt-injection
本站收录 52 个带「prompt-injection」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
iFixAiiFixAi 是一个面向 AI Agent 的独立审计工具,旨在快速回答 AI Agent 经济中最关键的问题:Agent 是否在按预期工作?它支持由人类或 A★ 16,623
superagentSuperagent 是一个专注于 AI 应用安全的开源库,主要解决提示注入、数据泄露和有害输出等安全问题。它提供轻量级 SDK,可嵌入现有 AI 应用,通过检★ 6,757
AI-Infra-GuardAI-Infra-Guard 是一个全栈 AI 红队测试平台,旨在系统性评估和加固 AI 生态系统的安全性。它解决了 AI 应用从模型、代理、技能到基础设施各层★ 6,636
llm-guardllm-guard 是一个面向大语言模型交互的安全工具包,旨在检测和缓解各类安全威胁,如提示注入、越狱攻击、敏感信息泄露等。它通过输入输出验证、内容过滤、异常检★ 3,212
ADRADR 是一个面向企业级 AI 智能体的安全防护框架,由 Uber 部署并开源。它解决的核心问题是:随着 AI Agent 在企业中承担越来越多的自动化任务,其★ 1,614
rebuffRebuff 是一个专注于检测和防御大语言模型提示注入攻击的开源工具。它解决的是 LLM 应用面临的安全问题,即恶意用户通过精心构造的输入提示,诱导模型执行非预★ 1,525
promptmappromptmap 是一款针对自定义 LLM 应用的安全扫描器,帮助开发者在部署前发现提示注入等安全漏洞。它通过自动化生成恶意提示模板,对应用进行黑盒测试,模拟★ 1,276
langkitLangKit 是一个面向大语言模型(LLM)的开源监控工具包,专注于从提示词和模型响应中提取信号,以保障应用的安全性和可靠性。它解决了 LLM 在生产环境中缺★ 997
gpt_jailbreak_status这是一个追踪 OpenAI GPT 语言模型越狱状态的开源项目,旨在实时更新 GPT 系列模型(如 ChatGPT)被越狱(即绕过安全限制)的进展。项目以 HT★ 933
pipelockpipelock 是一个开源的 AI 智能体防火墙,专注于 MCP(模型上下文协议)安全和智能体出口流量管控。它解决了 AI 智能体在调用外部工具和服务时面临的★ 913
agentdojoagentdojo 是一个用于评估 LLM 智能体攻击与防御的动态环境。它解决的核心问题是:随着 LLM 智能体被赋予调用外部工具和访问敏感数据的权限,针对这些★ 881
skylosSkylos 是一个开源的本地优先 PR 扫描工具,旨在合并代码前自动发现死代码、安全漏洞、密钥泄露、质量回退以及 AI 生成代码的常见错误。它通过静态分析和 ★ 838
hanshuang-codexhanshuang-codex 是一个用 Python 编写的开源实验项目,主要针对 GPT 6.0 与 workbuddyV4.1flash 等大模型开展“破★ 811
hol-guardhol-guard 是一个面向 AI 智能体的开源防病毒工具,旨在解决 AI 代理在运行时面临的多类安全威胁。它能够实时拦截高风险工具调用、敏感凭据访问、提示注★ 681
agent-opforagent-opfor 是一个开源的 AI 智能体对抗模拟工具,专注于对 AI 智能体和 MCP 服务器进行红队测试。它解决了 AI 应用在部署前缺乏系统性安全★ 582
AdrianAdrian 是一个开源的 AI 智能体安全运行时工具,专门用于监控和控制 AI 智能体的行为。它解决的是智能体在执行任务时可能出现的恶意工具调用、提示注入攻击★ 577
vigil-llmVigil 是一个专注于检测大语言模型(LLM)输入安全风险的开源基础设施工具。它主要解决提示注入(prompt injection)、越狱(jailbreak★ 497
awesome-MLSecOpsawesome-MLSecOps 是一个精选的 MLSecOps(机器学习安全运营)工具与资源清单,旨在帮助安全工程师、ML 工程师和 AI 团队系统性地保障机★ 473
SponsioSponsio 是一个面向概率性 AI 智能体的确定性安全解决方案框架。它通过为智能体提供可验证的安全护栏、运行时监控和技能沙箱,解决大模型输出不可控、工具调用★ 441
AutoHarnessAutoHarness 是一个面向 AI 智能体的自动化 Harness 工程工具,旨在解决智能体在复杂任务中的可控性、安全性和可观测性问题。它通过自动生成和优★ 412
prismorprismor 是一个自托管的 AI 智能体运行时控制平面,专注于在工具调用执行前提供安全防护。它解决了 AI 代理在自主执行过程中可能引发的安全问题,如秘密泄★ 379
agentsealAgentSeal 是一个面向 AI 智能体的安全工具包,主要解决 AI Agent 在运行时面临的安全风险,包括恶意技能、MCP 配置漏洞、供应链攻击、提示注★ 377
LLMVaultLLMVault 是一个专为 AI 安全设计的开源训练平台,基于 OWASP LLM Top 10 标准构建,帮助安全工程师、开发者和研究人员学习并实践大语言模★ 326
ZORG-Jailbreak-Prompt-TextZORG-Jailbreak-Prompt-Text 是一个专注于 AI 对话越狱提示词的开源项目,旨在帮助用户绕过 ChatGPT、Gemini、DeepSe★ 310
aegisaegis 是一个面向大型语言模型的自加固防火墙,属于基础设施类项目。它解决的是 LLM 在部署和交互过程中面临的安全威胁,如提示注入、恶意输出和数据泄露等问题★ 269
gpt_servergpt_server 是一个面向生产环境的 AI 服务部署框架,旨在统一集成多种主流模型能力,包括大语言模型(LLM)、Embedding、Reranker、A★ 253
agent-auditagent-audit 是一个针对 LLM 智能体的静态安全扫描工具,主要解决 AI Agent 应用中的安全漏洞问题,如提示注入、MCP 配置错误和污点分析。★ 233
safelabs-evalsafelabs-eval 是一个面向 AI 智能体的红队测试与评测框架,核心目标是把 OWASP ASI(Agentic Security Initiativ★ 220
node9-proxynode9-proxy 是一个面向 AI Agent 时代的执行安全层,为自主 AI 代理提供确定性的“Sudo”治理和审计日志。它解决的是当前 LLM 代理在★ 216
www-project-agent-memory-guardAgent Memory Guard 是 OWASP 基金会下的一个开源项目,专注于解决 AI 智能体(Agent)的记忆安全问题。随着大语言模型(LLM)驱动★ 183
prompt-guardprompt-guard 是一个面向 AI 智能体的高级提示注入防御系统,旨在解决大语言模型应用面临的提示注入攻击问题。它提供多语言检测能力,能够识别多种语言的★ 178
XSafeClawXSafeClaw 是复旦大学开源的多智能体安全评测平台,专注于检测和防御针对 LLM 智能体的安全威胁。它解决的核心问题是:随着 Agent 被赋予工具调用和★ 164
humanboundHumanbound 是一个开源的对抗性测试引擎,为 AI 智能体提供 SDK 和命令行工具,用于发现和修复智能体中的安全漏洞与逻辑缺陷。它解决的核心问题是:A★ 161
Awesome-LLMSecOpsAwesome-LLMSecOps 是一个专注于大语言模型(LLM)与智能体(Agent)安全运营的精选资源列表。它系统性地整理了 LLM 安全领域的威胁建模、★ 161
dodoguardDodoGuard 是一个面向 AI Agent 全生命周期的开源安全防护工具,用 TypeScript 编写,主要解决 Dify、Coze、FastGPT、n★ 158
Awesome-Embodied-AI-Safety这是一个关于具身AI安全领域的综述性开源项目,汇集了500多篇相关论文,系统梳理了具身AI在感知、认知、规划、交互和智能体系统等层面面临的风险、攻击与防御方法。★ 144
ai-safe2-frameworkAI SAFE² 是一个面向智能体 AI、非人类身份(NHI)和 AI 集群(Swarm)的治理、风险与合规(GRC)操作系统,同时集成了安全能力。它试图解决 ★ 143
shellwardshellward 是一个面向 AI 应用的合规与安全网关,旨在帮助开发者和企业快速识别并修复 AI 项目中的合规风险。它通过一行命令对项目进行静态体检,覆盖数★ 139
gatewaygateway 是一个开源的 LLM 防火墙,旨在为 AI 应用提供安全网关。它通过自托管方式,在应用与大模型之间建立统一入口,解决企业使用 AI 时的安全管控★ 132
context-bombscontext-bombs 是一个专注于 AI 安全与评测的开源项目,核心是提供一系列精心构造的“上下文炸弹”字符串,用于测试和评估 AI 系统在面临恶意或异常★ 131
autoguardrailsAutoGuardrails 是一个面向 LLM 护栏的 alignment-research 脚手架,采用 autoresearch 风格,在单一的 poli★ 130
PromptMePromptMe 是一个面向大语言模型安全的教育型开源项目,围绕 OWASP LLM Top 10 设计了 10 个动手挑战,帮助开发者和安全人员理解 LLM ★ 111
rampartrampart 是一个面向 AI 智能体的开源防火墙,采用 Go 语言开发。它通过策略引擎审计和控制 OpenClaw、Claude Code、Cursor、C★ 89
VeritensorVeritensor 是一个针对 AI 供应链的安全静态分析工具,定位为“AI 制品杀毒软件”和“RAG 防火墙”。它主要解决 AI 开发中模型、数据集、笔记本★ 86
awesome-llm-agent-papers这是一个精选的LLM智能体论文阅读清单,持续更新,收录了200多篇关于规划、记忆、工具使用、多智能体、评估与安全等主题的论文。项目旨在为研究者和开发者提供系统性★ 85
ShibaClawShibaClaw 是一个自托管的、安全优先的 AI 智能体框架,旨在解决用户对数据隐私和可控性的需求。它支持 28 个 AI 提供商和 11 种聊天渠道,提供★ 82
tensor-trusttensor-trust 是一个用于收集鲁棒机器学习研究数据的提示注入游戏。它通过游戏化的方式,让用户与AI模型进行对抗性交互,尝试通过精心设计的提示词来绕过模★ 78
awesome-ai-agents-security这是一个关于AI智能体安全的精选资源列表,旨在绘制AI代理安全生态系统的活地图。它系统整理了该领域的关键主题,包括自主代理、生成式AI、网络安全、护栏、越狱攻击★ 73
openclaw-superpowersopenclaw-superpowers 是一个为 OpenClaw 智能体框架设计的技能插件包,包含 44 个即插即用的技能模块,旨在增强自主智能体的能力。它★ 72
AegisGateAegisGate 是一个开源的 LLM API 安全网关,作为 OpenAI/Claude 兼容的代理层,为 AI 编码代理(如 Cursor、Claude ★ 68