adversarial-attacks

本站收录 16 个带「adversarial-attacks」标签的 AI 开源项目

L1B3RT4SL1B3RT4S 是一个以幽默和反讽方式呈现的提示词集合项目,旨在通过戏仿“越狱”提示词的形式,展示 AI 提示词工程的边界与可能性。它收集了大量看似“解放”A★ 21,585promptbenchPromptBench 是一个面向大语言模型的统一评估框架,旨在解决当前 LLM 评估碎片化、缺乏标准化的问题。它提供了一套模块化、可扩展的工具,支持对模型进行★ 2,822Awesome-LM-SSPAwesome-LM-SSP 是一个聚焦大模型安全、隐私与可信度的精选阅读清单,收录了相关论文、工具、数据集和攻击防御方法。它系统梳理了提示注入、越狱攻击、隐私★ 2,081APSDAPSD 是论文《从视觉角度评估对抗扰动的隐蔽性》的官方数据集,旨在解决对抗样本攻击中扰动隐蔽性难以量化评估的问题。该数据集提供了大量带有对抗扰动的图像样本,并★ 939photoguardPhotoGuard是一个旨在防御恶意AI图像编辑的开源项目,由MIT的研究人员开发。它通过给图像添加难以察觉的扰动,破坏扩散模型(如Stable Diffus★ 701PromptInjectPromptInject 是一个用于评估大型语言模型(LLM)对对抗性提示攻击鲁棒性的开源框架。它通过模块化方式组装提示词,帮助研究者和开发者定量分析模型在面对★ 526vigil-llmVigil 是一个专注于检测大语言模型(LLM)输入安全风险的开源基础设施工具。它主要解决提示注入(prompt injection)、越狱(jailbreak★ 497Anti-DreamBoothAnti-DreamBooth 是 ICCV 2023 收录的学术项目,旨在保护用户免受个性化文本到图像合成技术的滥用。随着 DreamBooth 等个性化生成★ 273aegisaegis 是一个面向大型语言模型的自加固防火墙,属于基础设施类项目。它解决的是 LLM 在部署和交互过程中面临的安全威胁,如提示注入、恶意输出和数据泄露等问题★ 269watchtowerAIShield Watchtower 是一个用于AI模型洞察与漏洞扫描的开源工具,旨在帮助开发者和安全团队深入理解AI模型的行为,并识别潜在的安全风险。它通过★ 203Awesome-Embodied-AI-Safety这是一个关于具身AI安全领域的综述性开源项目,汇集了500多篇相关论文,系统梳理了具身AI在感知、认知、规划、交互和智能体系统等层面面临的风险、攻击与防御方法。★ 144RWKURWKU是一个针对大语言模型(LLM)的“知识遗忘”基准测试框架,源自NeurIPS 2024论文。它解决的是大模型在预训练中可能记住敏感、过时或侵权知识,导致★ 102PCLAPCLA 是一个用于在 CARLA 模拟器中测试自动驾驶智能体的框架。它针对自动驾驶系统中的智能体(如感知、规划、控制模块)进行系统性测试,通过生成对抗性场景和★ 101Diffusion-MU-AttackDiffusion-MU-Attack 是 ECCV'24 论文的官方实现,针对安全导向的“遗忘学习”(unlearned)扩散模型,提出一种快速有效的攻击方法★ 89ASTRAASTRA 是亚马逊 Nova AI 安全挑战赛的冠军项目,作为攻击方团队,在实时对抗评估中击败了来自全球顶尖大学的防御团队。该项目专注于生成对抗性攻击,用于测★ 77SECASECA 是一个针对大语言模型(LLM)幻觉问题的对抗性攻击框架,发表于 NeurIPS 2025。它通过生成语义等价且连贯的对抗性提示,诱导模型产生与事实不符★ 73