hanshuang-codex

桌面端批量测大模型越狱提示,一键跑实验看边界

hanshuang-codex 是一个用 Python 编写的开源实验项目,主要针对 GPT 6.0 与 workbuddyV4.1flash 等大模型开展“破甲”(jailbreak)测试,即通过提示词注入、角色扮演、指令覆盖等手段绕过模型的安全对齐限制,观察其输出边界。项目基于 PySide6 构建桌面应用界面,并集成 codex-cli 相关能力,方便研究者批量构造、管理和执行测试用例,记录不同提示策略下的模型响应。它解决的是安全评测中手工构造越狱提示效率低、结果难复现的问题,为红队测试、模型安全对齐研究提供可操作的实验台。核心能力包括:提示模板管理、多轮注入实验编排、响应采集与对比、桌面端可视化操作。项目定位偏研究与教学,适合安全研究员、AI 对齐工程师用于评估模型鲁棒性,而非生产环境工具。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 646
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类评测安全
开发团队aimeoa
所属国家
官网地址
定价模式free
价格说明开源项目,免费使用
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型ai,codex,codex-cli,desktop-app,jailbreak,llm,openai-codex,prompt-injection,pyside6,python
GitHub 星标★ 646
30天Star增速
HF 下载量
上线时间2026-09-06 00:00:00
最近更新2026-09-27 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-28
浏览次数0

使用教程

核心亮点

  • 提供 PySide6 桌面界面,无需命令行即可构造和管理越狱测试用例
  • 集成 codex-cli,能直接对接模型执行提示注入实验并采集响应
  • 聚焦 GPT 6.0 与 workbuddyV4.1flash 等具体目标,实验场景明确、可复现

不足之处

  • 项目早期,文档与使用说明可能不完整,上手需自行摸索
  • 依赖特定模型版本与接口,目标模型更新后实验代码可能失效

适用场景

  • AI 安全研究员做红队测试,评估模型对越狱提示的防御能力
  • 大模型对齐工程师收集越狱样本,用于加固安全训练数据
  • 教学场景中演示提示注入原理与模型安全边界

替代项目

garak、PyRIT

项目介绍

hanshuang-codex 是评测安全领域的开源项目,由 aimeoa 开发,是 2026 年新上线的项目。

它收录于评测安全分类,该分类目前共有 474 个项目,GitHub 星标数为 646。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-27。免费使用。

它主要面向的使用场景是:AI安全研究员做红队测试,评估模型对越狱提示的防御能力。同类可对比的替代方案包括 garak、PyRIT。

上一篇:rizzo-pii

下一篇:keystone-bench

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1519 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2957 2026-09-12