SECA

用语义等价攻击,自动逼出 LLM 的幻觉破绽

SECA 是一个针对大语言模型(LLM)幻觉问题的对抗性攻击框架,发表于 NeurIPS 2025。它通过生成语义等价且连贯的对抗性提示,诱导模型产生与事实不符的幻觉输出,从而暴露模型在知识边界、推理一致性等方面的脆弱性。SECA 的核心能力包括:基于语义等价变换的自动攻击样本生成、保持文本连贯性的扰动策略、以及针对幻觉触发场景的定向评估。该工具主要服务于 LLM 安全研究者、模型开发者和红队测试人员,用于在部署前系统性地检测模型可能产生的幻觉风险,进而辅助改进模型的鲁棒性和事实性。项目代码以 Python 实现,当前处于早期阶段,星标数较少,但方法论新颖,适合学术研究与安全评测场景。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 73
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队Buyun-Liang
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型adversarial-attacks,large-language-models,llm-hallucination,llm-safety
GitHub 星标★ 73
30天Star增速
HF 下载量
上线时间2025-05-27 00:00:00
最近更新2026-08-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 提出语义等价变换攻击,能生成自然连贯的对抗样本,避免生硬改写
  • 聚焦幻觉触发场景,直接针对模型事实性缺陷,评测目标明确
  • 方法发表于 NeurIPS 2025,学术严谨性高,适合研究引用

不足之处

  • 项目处于早期,文档和社区支持待观察
  • 未提供预训练模型或大规模评测基准,上手需自行配置环境

适用场景

  • LLM 安全红队测试,评估模型幻觉鲁棒性
  • 模型发布前的事实性缺陷检测
  • 学术研究:对抗攻击与幻觉缓解方法对比

替代项目

PromptBench、TextAttack、OpenAttack

项目介绍

SECA 是评测安全领域的开源项目,由 Buyun-Liang 开发,2025 年首次发布。

它收录于评测安全分类,该分类目前共有 467 个项目,GitHub 星标数为 73。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-21。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:LLM安全红队测试,评估模型幻觉鲁棒性。同类可对比的替代方案包括 PromptBench、TextAttack、OpenAttack。

上一篇:tool-retrieval-benchmark

下一篇:Video-MME

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12