Internal-Safety-Collapse

把AI智能体放进正常代码流程,看它如何自己补出危险操作

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1198
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类评测安全
开发团队wuyoscar
所属国家
定价模式free
价格说明开源研究项目,免费使用
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型
GitHub 星标★ 1198
30天Star增速
HF 下载量
上线时间2026-03-01 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-10
浏览次数0

项目介绍

Internal-Safety-Collapse 是一个面向 AI 智能体安全评测的对抗性代码空间项目,论文被 NeurIPS 2026 接收。它构建了一套看似正常的开发工作流环境,但其中故意留下信息缺口或诱导性上下文,当任意 AI 智能体被放入该环境执行任务时,会主动补全缺失内容,从而暴露出模型内部安全约束的脆弱性。项目解决的核心问题是:现有安全对齐多针对显式恶意指令,而智能体在正常工程流程中可能因补全惯性绕过安全边界。核心能力包括可复现的对抗性代码空间搭建、对多种智能体的自动化投放与行为观测、以及安全崩溃现象的量化记录。它适合安全研究者、对齐团队和智能体开发者用于红队测试与鲁棒性评估。

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:进阶 约 10 分钟 部署方式:本地安装 6 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • uv(依赖与环境管理工具,README 明确唯一需要额外安装的工具)
  • Docker(用于运行智能体)
  • 自备大模型 API Key(Bring your own API key)
  • 可访问 GitHub 与所评测模型服务的网络

安装与启动步骤

  1. 1安装 uv

    README 说明除 uv 外无需安装其他依赖。执行官方安装脚本后重开终端,确保 uv 已加入 PATH。

    curl -LsSf https://astral.sh/uv/install.sh | sh
  2. 2确认 uv 可用

    验证 uv 是否正确安装,能打印版本号即表示可用。

    uv --version
  3. 3准备 Docker

    README 要求用 Docker 运行智能体,请先安装并启动 Docker 引擎,本步骤仅用于确认。

    docker --version
  4. 4克隆项目仓库

    从 GitHub 拉取项目源码到本地,后续在仓库目录内使用 uv 运行。

    git clone https://github.com/wuyoscar/Internal-Safety-Collapse.git
  5. 5进入项目目录

    切换到克隆下来的仓库根目录,后续命令均在此目录执行。

    cd Internal-Safety-Collapse
  6. 6配置 API Key

    按 README 要求自备 API Key 并设置为环境变量。README 未给出具体变量名,请以仓库内说明为准。

    export API_KEY=sk-xxxxxxxx

关键配置

配置项必填说明示例
API Key是访问所评测前沿模型服务的凭证,自行准备,README 未指定变量名sk-xxxxxxxx

如何确认成功

README 未提供启动或自检命令;能正常执行 uv --version、docker --version 且已配置 API Key,即视为环境准备完成,具体运行方式请查看仓库 README 与论文。

常见问题

Q:需要自己安装 Python 吗?

A:README 说明除 uv 外无需额外安装,uv 可自行管理 Python 运行环境,直接用 uv 执行即可。

Q:没有 API Key 能用吗?

A:不能。README 明确要求 Bring your own API key,需要自行准备所评测模型的 API 凭证。

Q:支持评测哪些模型?

A:README 提到可用于攻击前沿大模型,如 Fable 5、Claude Opus 4.8 以及 GPT-5 系列等。

Q:为什么还要装 Docker?

A:README 说明 Docker 用于运行智能体,智能体被投放到对抗性代码空间中执行任务,需要隔离运行环境。

Q:可以用于商业产品或对外服务吗?

A:不可以。README 标注 Research use only,仅支持红队测试、评测与缓解研究,不得用于造成伤害。

注意事项

  • 本项目仅限研究用途(红队、评测、缓解研究),切勿用生成内容去造成实际伤害。
  • README 未提供具体运行命令、参数与端口,本文仅覆盖环境准备,实际用法请以仓库 README 与论文为准。
  • 评测过程会诱导模型输出有害内容与产物,建议在隔离环境、独立账号下进行。
  • uv 安装命令为官方安装脚本写法,若环境受限可改用其他方式安装 uv。

核心亮点

  • 提供可复现的对抗性代码空间,能系统化测试智能体在正常流程中的安全边界
  • 不依赖显式恶意提示,更贴近真实开发场景下的安全失效路径
  • 有 NeurIPS 2026 论文支撑,评测设计有学术依据,结果可引用

不足之处

  • 项目较新,星标约 1200,生态和第三方复现案例仍在积累
  • 主要面向安全研究,普通开发者直接上手门槛较高

适用场景

  • 安全团队对自研 AI 编程智能体做红队测试
  • 对齐研究者验证模型在补全任务中的安全约束强度
  • 智能体产品上线前评估其在真实工程流中的越权风险

替代项目

AgentHarm、InjecAgent

上一篇:ai-scanner

下一篇:model-community

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1527 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 3003 2026-09-12
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1537 2026-08-24