skills-benchmarks

给 AI 智能体技能上秤,跑分对比不靠嘴

skills-benchmarks 是一个面向 AI 智能体技能(skills)的评测基准集合,用 JavaScript 实现。它要解决的问题是:当前大量 AI Agent 项目宣称自己会调用工具、执行多步任务,但缺少统一、可复现的量化标准,导致能力好坏只能靠演示和主观感受判断。项目提供了一套可运行的基准任务与打分流程,把技能拆成具体场景来测,输出可对比的结果,帮助开发者在选型、迭代或发布前拿到客观数据。核心能力包括:定义标准化任务集、自动执行并采集结果、按维度给出评分,以及便于扩展新技能测试的框架结构。它适合做 Agent 框架、工具调用、多步规划等方向的横向对比,也适合团队内部做回归测试,防止版本升级后能力退化。项目目前处于早期,星标不多,但方向明确,是给智能体能力“上秤”的基础设施型工具。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 117
维护状态 维护中
是否开源
定价模式 free

项目数据

分类评测安全
开发团队langchain-ai
所属国家
官网地址
定价模式free
价格说明开源免费
访问状态
是否开源
开源协议MIT
主要语言JavaScript
技术栈/模型
GitHub 星标★ 117
30天Star增速
HF 下载量
上线时间2026-01-24 00:00:00
最近更新2026-09-17 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-12
浏览次数5

使用教程

核心亮点

  • 把智能体技能拆成可执行任务并自动打分,结果可复现、可横向对比
  • 用 JavaScript 实现,前端和 Node 生态的开发者接入成本低
  • 框架结构便于扩展新技能测试,适合做团队内部回归基准

不足之处

  • 项目处于早期,任务覆盖面和评测维度可能还不够全面
  • 文档和社区规模较小,遇到问题可参考的案例有限

适用场景

  • 对比不同 Agent 框架或工具调用方案的实际能力差异
  • 团队迭代智能体版本时做回归测试,防止能力退化
  • 发布前用统一基准给模型或技能组合做量化体检

替代项目

SWE-bench、AgentBench

项目介绍

skills-benchmarks 是一个评测安全领域的开源项目,官方简介:暂无简介。项目使用 JavaScript 开发,在 GitHub 上获得 116 星标。

上一篇:openevals

下一篇:EvalForge

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1516 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24