项目预览
项目数据
项目介绍
Star 增长趋势
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
技术标签
使用教程
—
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
环境要求
- uv(依赖与环境管理工具,README 明确唯一需要额外安装的工具)
- Docker(用于运行智能体)
- 自备大模型 API Key(Bring your own API key)
- 可访问 GitHub 与所评测模型服务的网络
安装与启动步骤
-
1安装 uv
README 说明除 uv 外无需安装其他依赖。执行官方安装脚本后重开终端,确保 uv 已加入 PATH。
curl -LsSf https://astral.sh/uv/install.sh | sh -
2确认 uv 可用
验证 uv 是否正确安装,能打印版本号即表示可用。
uv --version -
3准备 Docker
README 要求用 Docker 运行智能体,请先安装并启动 Docker 引擎,本步骤仅用于确认。
docker --version -
4克隆项目仓库
从 GitHub 拉取项目源码到本地,后续在仓库目录内使用 uv 运行。
git clone https://github.com/wuyoscar/Internal-Safety-Collapse.git -
5进入项目目录
切换到克隆下来的仓库根目录,后续命令均在此目录执行。
cd Internal-Safety-Collapse -
6配置 API Key
按 README 要求自备 API Key 并设置为环境变量。README 未给出具体变量名,请以仓库内说明为准。
export API_KEY=sk-xxxxxxxx
关键配置
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
API Key | 是 | 访问所评测前沿模型服务的凭证,自行准备,README 未指定变量名 | sk-xxxxxxxx |
如何确认成功
README 未提供启动或自检命令;能正常执行 uv --version、docker --version 且已配置 API Key,即视为环境准备完成,具体运行方式请查看仓库 README 与论文。
常见问题
Q:需要自己安装 Python 吗?
A:README 说明除 uv 外无需额外安装,uv 可自行管理 Python 运行环境,直接用 uv 执行即可。
Q:没有 API Key 能用吗?
A:不能。README 明确要求 Bring your own API key,需要自行准备所评测模型的 API 凭证。
Q:支持评测哪些模型?
A:README 提到可用于攻击前沿大模型,如 Fable 5、Claude Opus 4.8 以及 GPT-5 系列等。
Q:为什么还要装 Docker?
A:README 说明 Docker 用于运行智能体,智能体被投放到对抗性代码空间中执行任务,需要隔离运行环境。
Q:可以用于商业产品或对外服务吗?
A:不可以。README 标注 Research use only,仅支持红队测试、评测与缓解研究,不得用于造成伤害。
注意事项
- 本项目仅限研究用途(红队、评测、缓解研究),切勿用生成内容去造成实际伤害。
- README 未提供具体运行命令、参数与端口,本文仅覆盖环境准备,实际用法请以仓库 README 与论文为准。
- 评测过程会诱导模型输出有害内容与产物,建议在隔离环境、独立账号下进行。
- uv 安装命令为官方安装脚本写法,若环境受限可改用其他方式安装 uv。
核心亮点
- 提供可复现的对抗性代码空间,能系统化测试智能体在正常流程中的安全边界
- 不依赖显式恶意提示,更贴近真实开发场景下的安全失效路径
- 有 NeurIPS 2026 论文支撑,评测设计有学术依据,结果可引用
不足之处
- 项目较新,星标约 1200,生态和第三方复现案例仍在积累
- 主要面向安全研究,普通开发者直接上手门槛较高
适用场景
- 安全团队对自研 AI 编程智能体做红队测试
- 对齐研究者验证模型在补全任务中的安全约束强度
- 智能体产品上线前评估其在真实工程流中的越权风险
替代项目
AgentHarm、InjecAgent
上一篇:ai-scanner
下一篇:model-community
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
