openbench 是评测安全领域的开源项目,由 minghinmatthewlam 开发,是 2026 年新上线的项目。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 134。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-20。MIT许可证,完全免费,无付费版本。
它主要面向的使用场景是:企业评估不同编码智能体框架,选择性价比最高的方案。同类可对比的替代方案包括 SWE-bench、HumanEval、BigCodeBench。

同一模型,不同封装,一测便知谁更省更快更准。
openbench 是一个从零构建的基准测试项目,用于横向对比不同编码智能体框架(如 codex、pi、opencode、cursor、devin)以及开放模型在代码生成任务上的表现。它解决的核心问题是:同一模型在不同封装下,实际编码效果、速度和 Token 成本差异巨大,但缺乏客观、可复现的评测数据。项目通过统一的任务集和评估流程,量化各智能体在正确性、执行速度和 Token 消耗三个维度的表现,帮助开发者或团队选择最适合自身需求的智能体框架。其核心能力包括自动化运行测试、标准化评分、成本统计,以及支持自定义模型和框架接入。作为早期项目,它聚焦于评测透明化,为 AI 编码工具选型提供数据支撑。
SWE-bench、HumanEval、BigCodeBench
openbench 是评测安全领域的开源项目,由 minghinmatthewlam 开发,是 2026 年新上线的项目。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 134。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-20。MIT许可证,完全免费,无付费版本。
它主要面向的使用场景是:企业评估不同编码智能体框架,选择性价比最高的方案。同类可对比的替代方案包括 SWE-bench、HumanEval、BigCodeBench。
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.