evals-skills

跟着课程搭 LLM 评测体系,把主观质量变成可复现指标

evals-skills 是面向 AI 评测领域的技能集合,配套《AI Evals For Engineers & PMs》课程使用,帮助工程师和产品经理系统化地搭建大模型评测体系。它解决的核心问题是:很多人做 AI 产品时不知道如何设计评测集、如何定义评分标准、如何把主观质量转化为可复现的指标。项目把评测方法论拆解成可复用的技能模块,覆盖评测用例设计、评分器编写、结果分析等环节,让团队能像写单元测试一样为 LLM 应用建立回归测试。核心能力包括提供结构化的评测流程模板、可参考的评分维度与提示词范式,以及与课程内容对应的实操练习,降低从零搭建评测框架的门槛。适合正在做 RAG、Agent 或对话产品的团队快速引入评测规范。

开源 paid_only 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1668
维护状态 维护中
是否开源
定价模式 paid_only

项目数据

分类评测安全
开发团队hamelsmu
所属国家
定价模式paid_only
价格说明Maven课程付费,定价信息待确认
访问状态
是否开源
开源协议MIT
主要语言
技术栈/模型
GitHub 星标★ 1668
30天Star增速
HF 下载量
上线时间2026-03-01 00:00:00
最近更新2026-09-16 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-14
浏览次数0

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 7 步

环境要求

  • Claude Code(使用 /plugin 方式安装时需要)
  • Node.js 环境,可用 npx 命令(使用 npx skills 方式时需要)
  • 可访问 GitHub 的网络环境

安装与启动步骤

  1. 1注意仓库已迁移

    本仓库已废弃,官方技能已迁移到 ai-evals-course/evals-skills 插件,建议直接用新地址安装。

  2. 2注册插件市场

    在 Claude Code 中执行,把 hamelsmu/evals-skills 注册为插件来源仓库。

    /plugin marketplace add hamelsmu/evals-skills
  3. 3安装插件

    仍在 Claude Code 中执行,安装 evals-skills 插件本体。

    /plugin install evals-skills@hamelsmu-evals-skills
  4. 4重启 Claude Code

    安装完成后必须重启 Claude Code,插件中的技能才会加载生效。

  5. 5npx 方式安装

    不使用 Claude Code 插件时,可通过开放 Skills CLI 从 GitHub 仓库安装。

    npx skills add https://github.com/hamelsmu/evals-skills
  6. 6只装单个技能

    只想安装 eval-audit 这一个技能时,加 --skill 参数指定技能名。

    npx skills add https://github.com/hamelsmu/evals-skills --skill eval-audit
  7. 7运行评测审计

    在 Claude Code 中对你的评测流程调用 eval-audit 技能,逐项排查并汇总报告。

    /evals-skills:eval-audit

如何确认成功

重启 Claude Code 后,输入 / 能看到 /evals-skills: 形式的技能,并能成功调用 eval-audit。

常见问题

Q:原仓库 hamelsmu/evals-skills 还能用吗?

A:该仓库已标记废弃,技能迁移到 ai-evals-course/evals-skills,官方推荐直接安装新仓库版本。

Q:不装 Claude Code 插件可以用吗?

A:可以。使用开放 Skills CLI,执行 npx skills add 从仓库地址安装即可。

Q:如何升级已安装的插件或技能?

A:插件方式执行 /plugin update evals-skills@hamelsmu-evals-skills;npx 方式执行 npx skills check 再 npx skills update。

Q:安装后技能没有出现怎么办?

A:确认安装命令执行成功,并重启 Claude Code;技能会以 /evals-skills: 形式出现。

注意事项

  • 本仓库已废弃,技能已迁移至 ai-evals-course/evals-skills,建议优先使用新地址安装。
  • 插件安装完成后必须重启 Claude Code 才会加载技能。
  • eval-audit 不是完整解决方案,但能发现评测中的常见问题,并推荐其他技能来修复。

核心亮点

  • 与课程内容强绑定,方法论到实操的路径清晰,适合边学边用
  • 把评测拆成可复用技能模块,便于团队按环节逐步引入而非一次性重构
  • 面向工程师和 PM 双角色设计,有助于产品与研发对齐评测标准

不足之处

  • 项目以课程配套技能为主,缺少开箱即用的完整评测平台或自动化流水线
  • 语言和技术栈信息不明确,实际落地时需要自行适配现有工程环境

适用场景

  • 团队要为 RAG 问答产品建立上线前的质量回归测试
  • PM 想把用户反馈中的主观问题转化为可量化的评测维度
  • 工程师在课程学习后,需要一套可复用的评测用例与评分器模板

替代项目

promptfoo、DeepEval

项目介绍

evals-skills 是一个评测安全领域的开源项目,官方简介:Skills for AI Evals to compliment the course: AI Evals For Engineers & PMs。项目使用 未知 开发,在 GitHub 上获得 1665 星标。

上一篇:inspect_evals

下一篇:gbrain-evals

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24