GitTaskBench

用真实仓库任务,测出代码代理的真实水平

GitTaskBench 是一个面向真实世界代码代理的仓库级基准测试平台,旨在全面评估 AI 编程助手在复杂软件开发任务中的能力。它解决的问题是现有基准测试过于简化、无法反映真实开发流程的问题。该平台将任务分解为从仓库理解、环境搭建、增量开发/缺陷修复到任务交付的完整链路,并引入成本感知的 α 指标,在衡量任务完成质量的同时兼顾执行成本。其核心能力包括:提供标准化的仓库级任务集、自动化评估流程、以及可复现的对比实验环境。通过模拟真实开发场景,GitTaskBench 帮助开发者、研究者和企业客观比较不同代码代理的性能,推动更实用、更高效的 AI 编程工具发展。

开源 free 编程开发
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 259
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类编程开发
开发团队QuantaAlpha
所属国家
定价模式free
价格说明开源基准测试项目,完全免费,无付费版本。
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型claude-code,code-agent,code-llm,openhands,repo-level,repomaster,swe-agent
GitHub 星标★ 259
30天Star增速
HF 下载量
上线时间2025-08-17 00:00:00
最近更新2026-09-24 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 覆盖从仓库理解到交付的完整开发流程,评估更贴近实际
  • 引入成本感知 α 指标,兼顾效果与资源消耗,评估更全面
  • 基于真实仓库任务,避免玩具级测试,结果更有说服力

不足之处

  • 早期项目,任务集规模和多样性可能有限
  • 文档和社区生态待观察

适用场景

  • 对比评测不同代码代理(如 Copilot、Codex)的实战能力
  • 研究机构用于验证新代码生成/修复算法的有效性
  • 企业选型时评估 AI 编程工具在内部仓库上的表现

替代项目

SWE-bench、HumanEval、RepoBench

项目介绍

GitTaskBench 是评测安全领域的开源项目,由 QuantaAlpha 开发,2025 年首次发布。

它收录于评测安全分类,该分类目前共有 467 个项目,GitHub 星标数为 259。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-24。开源基准测试项目,完全免费,无付费版本。

它主要面向的使用场景是:对比评测不同代码代理(如Copilot、Codex)的实战能力。同类可对比的替代方案包括 SWE-bench、HumanEval、RepoBench。

上一篇:AlgoTune

下一篇:WormGPT

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12