
BackdoorLLM
统一评测 LLM 后门攻防,一键复现与对比
BackdoorLLM 是一个面向大语言模型后门攻击与防御的综合基准测试平台,入选 NeurIPS 2025。它解决的核心问题是:现有 LLM 后门研究缺乏统一、可复现的评测标准,不同论文的攻击方法、防御策略和数据集各不相同,导致结果难以横向比较。项目提供标准化的攻击注入流程、多种触发模式(如词级、句级、指令级)、覆盖生成与分类任务的评测协议,并集成主流开源 LLM 作为受害模型。核心能力包括:一键复现多种后门攻击、统一评估防御方法的鲁棒性、提供量化指标(攻击成功率、干净准确率等),帮助研究者和工程师快速验证模型安全性,推动 LLM 供应链安全研究。
开源
free
评测安全
GitHub 星标
★ 326
维护状态
较活跃
是否开源
是
定价模式
free
项目数据
分类评测安全
开发团队bboylyg
所属国家
定价模式free
价格说明开源基准,免费使用
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型attack,backdoor,defense,llms,llms-benchmarking
GitHub 星标★ 326
30天Star增速
HF 下载量
上线时间2024-08-21 00:00:00
最近更新2026-09-08 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0
使用教程
核心亮点
- 提供标准化攻击与防御评测流程,结果可横向对比
- 覆盖多种触发模式和任务类型,适配主流开源 LLM
- 入选 NeurIPS 2025,学术认可度高,代码结构清晰
不足之处
- 项目处于早期,星标数较少,社区生态和文档完善度待观察
- 可能未覆盖所有闭源商业模型和最新攻击变体
适用场景
- 研究 LLM 后门攻击与防御的学术实验
- 企业评估第三方模型或微调模型的安全风险
- 教学演示后门攻击原理与防御效果
替代项目
OpenBackdoor、BackdoorBench
项目介绍
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents