agent-skills-eval 是评测安全领域的开源项目,由 darkrishabh 开发,是 2026 年新上线的项目。
在全站 13,090 个收录项目中,它的 GitHub 星标数(792)位列前 30%,在评测安全分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,无付费版本。
它主要面向的使用场景是:智能体技能开发中的回归测试。同类可对比的替代方案包括 promptfoo、DeepEval、LangSmith。

跑一遍测试,就知道你的 AI 技能行不行
agent-skills-eval 是一个用于测试 AI 智能体技能(Agent Skills)的测试运行器,灵感来自 agentskills.io。它解决的核心问题是:当开发者基于 OpenAI 兼容接口构建智能体技能时,缺乏一套标准化的评测工具来验证技能是否按预期工作。该项目提供 CLI 工具,通过 YAML 定义测试用例,以 JSONL 格式输出评测结果,支持与主流 LLM 接口对接。其核心能力包括:定义多步骤测试场景、自动执行智能体调用、对输出进行断言校验、生成结构化报告。它帮助开发者在开发周期中快速回归测试智能体行为,确保技能更新不破坏已有功能,从而提升智能体开发的可靠性和迭代效率。项目采用 TypeScript 编写,设计简洁,易于集成到 CI/CD 流程中。
promptfoo、DeepEval、LangSmith
agent-skills-eval 是评测安全领域的开源项目,由 darkrishabh 开发,是 2026 年新上线的项目。
在全站 13,090 个收录项目中,它的 GitHub 星标数(792)位列前 30%,在评测安全分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,无付费版本。
它主要面向的使用场景是:智能体技能开发中的回归测试。同类可对比的替代方案包括 promptfoo、DeepEval、LangSmith。
上一篇:AgentHound
下一篇:empirica
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.