aiewf-eval

专测大模型长上下文下的安全表现

aiewf-eval 是 AI 安全评测框架 AIEWF 的评测套件,专注于长上下文场景下的模型行为评估。它解决的核心问题是:当大模型处理超长输入(如长文档、多轮对话、代码仓库)时,其安全性、指令遵循和推理能力是否稳定,而现有评测集大多只覆盖短上下文。项目提供可复现的评测流程,支持加载长文本样本、调用被测模型、记录输出并按维度打分,方便研究者对比不同模型或防护策略在长上下文下的表现。语言为 Python,便于集成到现有评测管线。作为早期项目(约 161 星),它更适合作为长上下文安全评测的起点和参考实现,而非开箱即用的完整平台。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 161
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队kwindla
所属国家
官网地址
定价模式free
价格说明开源免费,无在线服务
访问状态
是否开源
开源协议
主要语言Python
技术栈/模型
GitHub 星标★ 161
30天Star增速
HF 下载量
上线时间2025-12-04 00:00:00
最近更新2026-08-27 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-14
浏览次数0

使用教程

核心亮点

  • 聚焦长上下文安全评测,填补短上下文评测集覆盖不到的空白
  • Python 实现,评测流程可复现,便于研究者二次开发和集成
  • 围绕 AI 安全评测组织样本与打分维度,目标明确,不是泛化的通用评测

不足之处

  • 早期项目,星标和社区规模有限,文档与示例可能不完整
  • 长上下文评测对算力和 token 成本要求高,实际跑全量样本门槛不低

适用场景

  • 评估模型在超长文档问答中是否泄露敏感信息
  • 对比不同模型在多轮长对话下的安全对齐稳定性
  • 为长上下文防护策略(如截断、摘要、检索)做效果验证

替代项目

lm-evaluation-harness、HELM

项目介绍

aiewf-eval 是一个评测安全领域的开源项目,官方简介:A long-context eval。项目使用 Python 开发,在 GitHub 上获得 161 星标。

上一篇:inspect-robots

下一篇:claw-eval

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1516 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24