
claw-eval
接入模型跑人工校验任务,快速量化智能体能力
claw-eval 是一个面向 LLM 智能体(LLM as agents)的评测框架(evaluation harness),核心目标是解决当前智能体评测中任务质量参差、结果不可复现、缺乏统一标准的问题。它提供一套结构化的任务集合与运行环境,让开发者把待测模型接入后,按统一流程执行任务并得到可比较的评分结果。项目强调所有任务均由人工验证(verified by humans),从而减少自动生成任务带来的噪声和偏差,提升评测结论的可信度。技术栈基于 Python,围绕 agent、harness、llm、openclaw 等关键词构建,适合作为模型选型、能力回归测试和智能体迭代过程中的基准工具。当前星标约 773,属于早期项目,但已具备可用的评测骨架,适合关注智能体能力量化评估的研究者与工程团队快速上手。
项目数据
使用教程
核心亮点
- 任务全部经过人工验证,评测结果可信度高于纯自动生成的数据集
- 提供统一的 harness 运行框架,便于对不同模型做横向对比
- 基于 Python,接入和二次开发门槛较低,适合快速集成到现有评测流程
不足之处
- 项目处于早期阶段,任务覆盖面和评测维度可能还不够全面
- 文档与社区生态相对有限,遇到问题可参考的案例和讨论较少
适用场景
- 模型选型时对比多个 LLM 在智能体任务上的实际表现
- 智能体产品迭代中做能力回归测试,防止新版本性能退化
- 学术或工程团队构建自定义评测基准时复用其任务与运行框架
替代项目
AgentBench、SWE-bench、WebArena
项目介绍
上一篇:aiewf-eval
下一篇:faster_coco_eval
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents