openbench

同一模型,不同封装,一测便知谁更省更快更准。

openbench 是一个从零构建的基准测试项目,用于横向对比不同编码智能体框架(如 codex、pi、opencode、cursor、devin)以及开放模型在代码生成任务上的表现。它解决的核心问题是:同一模型在不同封装下,实际编码效果、速度和 Token 成本差异巨大,但缺乏客观、可复现的评测数据。项目通过统一的任务集和评估流程,量化各智能体在正确性、执行速度和 Token 消耗三个维度的表现,帮助开发者或团队选择最适合自身需求的智能体框架。其核心能力包括自动化运行测试、标准化评分、成本统计,以及支持自定义模型和框架接入。作为早期项目,它聚焦于评测透明化,为 AI 编码工具选型提供数据支撑。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 134
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类评测安全
开发团队minghinmatthewlam
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型ai-agents,benchmark,coding-agents,evals,llm,open-models
GitHub 星标★ 134
30天Star增速
HF 下载量
上线时间2026-06-19 00:00:00
最近更新2026-09-20 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数8

使用教程

核心亮点

  • 从零构建,不依赖现有评测库,测试逻辑透明可控
  • 统一对比多个主流编码智能体(codex、cursor、devin等),选型参考价值高
  • 同时评估正确性、速度和Token成本,兼顾质量与经济效益

不足之处

  • 项目处于早期阶段,测试任务集覆盖场景可能有限
  • 文档和社区生态尚待完善,上手使用需一定技术背景

适用场景

  • 企业评估不同编码智能体框架,选择性价比最高的方案
  • 开发者对比同一模型在不同工具下的实际表现,优化个人工作流
  • 研究机构或评测团队建立编码智能体的标准化评测体系

替代项目

SWE-bench、HumanEval、BigCodeBench

项目介绍

openbench 是评测安全领域的开源项目,由 minghinmatthewlam 开发,是 2026 年新上线的项目。

它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 134。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-20。MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:企业评估不同编码智能体框架,选择性价比最高的方案。同类可对比的替代方案包括 SWE-bench、HumanEval、BigCodeBench。

上一篇:AgentEval

下一篇:evals

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12