
ClawProBench
在真实 OpenClaw 里反复跑 Agent,用确定性打分比出谁更稳
ClawProBench 是一个面向 LLM Agent 的评测基准框架,专门针对 OpenClaw 运行时环境设计。它解决的核心问题是:当前多数 Agent 评测依赖静态数据集或一次性运行结果,难以反映真实运行环境下的稳定性与可复现性。ClawProBench 采用 live-first 思路,在真实 OpenClaw 运行时中执行 Agent 任务,并通过确定性评分机制和重复试验来量化可靠性,而不是只看单次成功率。项目用 Rust 编写,强调执行效率与结果一致性,提供 harness 化的评测流程,可对接排行榜,适合需要横向对比不同 Agent 策略、模型或工具调用方案的研究者与工程团队。其核心能力包括:在 OpenClaw 环境中驱动 Agent 完成任务、对输出做确定性判分、通过多次重复试验统计稳定性指标,并支持将结果汇总为可比较的榜单数据。
项目数据
使用教程
核心亮点
- live-first 设计,在真实 OpenClaw 运行时评测而非离线数据集,结果更贴近实际部署表现
- 引入重复试验与确定性评分,能区分偶然成功和稳定可靠,弥补单次评测的偏差
- 用 Rust 实现,执行效率和资源控制较好,适合批量重复跑评测任务
不足之处
- 强绑定 OpenClaw 运行时,换其他 Agent 框架时迁移成本高
- 早期项目,823 星标,生态与文档完善度待观察
适用场景
- 对比不同 LLM 在 OpenClaw 中执行多步工具调用任务的稳定性
- 为 Agent 策略迭代提供可复现的回归评测与排行榜数据
- 在 CI 流程中定期跑 Agent 基准,监控模型或提示词变更带来的可靠性波动
替代项目
SWE-bench、AgentBench、WebArena
项目介绍
下一篇:dingo
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents