aws-bench 是评测安全领域的开源项目,由 aws-bench 开发,是 2026 年新上线的项目。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 131。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0 许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:AI智能体云运维能力评测与选型。同类可对比的替代方案包括 GAIA、AgentBench、ToolBench。

给AI智能体在真实AWS云上打分的基准测试
aws-bench 是一个用于评估 AI 智能体在真实 AWS 云环境中执行任务能力的基准测试工具。它针对云运维场景,如诊断配置错误、部署基础设施和操作实时云环境,量化不同智能体与模型组合的表现。该项目通过模拟或调用真实 AWS 服务,提供标准化的测试任务集和评分机制,帮助开发者对比和优化智能体的云操作能力。其核心价值在于填补了云原生智能体评测的空白,将抽象智能体能力转化为可量化的云任务成功率、效率和安全性指标。目前项目处于早期阶段,星标数较少,但定位清晰,专注于 AWS 生态,为后续扩展到多云或更多场景提供了基础。
GAIA、AgentBench、ToolBench
aws-bench 是评测安全领域的开源项目,由 aws-bench 开发,是 2026 年新上线的项目。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 131。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0 许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:AI智能体云运维能力评测与选型。同类可对比的替代方案包括 GAIA、AgentBench、ToolBench。
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.