
skills-benchmarks
给 AI 智能体技能上秤,跑分对比不靠嘴
skills-benchmarks 是一个面向 AI 智能体技能(skills)的评测基准集合,用 JavaScript 实现。它要解决的问题是:当前大量 AI Agent 项目宣称自己会调用工具、执行多步任务,但缺少统一、可复现的量化标准,导致能力好坏只能靠演示和主观感受判断。项目提供了一套可运行的基准任务与打分流程,把技能拆成具体场景来测,输出可对比的结果,帮助开发者在选型、迭代或发布前拿到客观数据。核心能力包括:定义标准化任务集、自动执行并采集结果、按维度给出评分,以及便于扩展新技能测试的框架结构。它适合做 Agent 框架、工具调用、多步规划等方向的横向对比,也适合团队内部做回归测试,防止版本升级后能力退化。项目目前处于早期,星标不多,但方向明确,是给智能体能力“上秤”的基础设施型工具。
项目数据
使用教程
核心亮点
- 把智能体技能拆成可执行任务并自动打分,结果可复现、可横向对比
- 用 JavaScript 实现,前端和 Node 生态的开发者接入成本低
- 框架结构便于扩展新技能测试,适合做团队内部回归基准
不足之处
- 项目处于早期,任务覆盖面和评测维度可能还不够全面
- 文档和社区规模较小,遇到问题可参考的案例有限
适用场景
- 对比不同 Agent 框架或工具调用方案的实际能力差异
- 团队迭代智能体版本时做回归测试,防止能力退化
- 发布前用统一基准给模型或技能组合做量化体检
替代项目
SWE-bench、AgentBench
项目介绍
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents