SWE-bench_Pro-os 是评测安全领域的开源项目,由 scaleapi 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 482 个项目,GitHub 星标数为 534。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-30。开源基准测试,免费使用。
它主要面向的使用场景是:评估自研CodingAgent在复杂工程任务上的真实完成率。同类可对比的替代方案包括 SWE-bench、AgentBench。

用长周期工程任务,真实测出 AI Agent 的软件工程上限
SWE-bench_Pro-os 是 SWE-bench Pro 评测基准的开源实现,专门用于衡量 AI Agent 在长周期、多步骤软件工程任务中的真实能力。传统 SWE-bench 多聚焦单点 bug 修复,而本项目把任务拉长到需要跨文件、跨模块、多轮工具调用才能完成的复杂工程场景,覆盖需求理解、代码定位、修改、测试验证等完整链路。它提供统一的评测环境、任务数据集与执行框架,让研究者能可复现地对比不同 Agent 方案在长程任务上的表现,暴露规划、上下文管理与错误恢复等短板。对做 Agent 研发、模型能力评估或工程自动化的人来说,它是一把更贴近真实开发难度的尺子。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
SWE-bench、AgentBench
SWE-bench_Pro-os 是评测安全领域的开源项目,由 scaleapi 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 482 个项目,GitHub 星标数为 534。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-30。开源基准测试,免费使用。
它主要面向的使用场景是:评估自研CodingAgent在复杂工程任务上的真实完成率。同类可对比的替代方案包括 SWE-bench、AgentBench。
上一篇:awesome-rsi
下一篇:tts-bench
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents