vitest-evals

用 Vitest 写 LLM 评测,像跑单测一样跑模型回归

vitest-evals 是一个把大模型评测(evals)直接嵌入 Vitest 测试框架的 TypeScript 扩展。它解决的问题是:传统上跑 LLM 评测要另起一套脚本、单独管理数据集和评分逻辑,和项目现有的测试流程割裂。这个项目让你用熟悉的 describe/it/expect 写法定义评测用例,把模型输出当作断言对象,从而复用 Vitest 的并行执行、watch 模式、报告器和 CI 集成。核心能力包括:在测试文件中声明评测任务、对模型回答做结构化断言、支持打分函数与阈值判断,并借助 Vitest 生态输出可读的通过/失败结果。它适合已经在用 Vitest 的前端或 Node 团队,用最低迁移成本给提示词、模型版本或 RAG 链路建立回归测试,把评测变成日常开发的一部分,而不是上线前临时补的一次性工作。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 343
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队getsentry
所属国家
官网地址
定价模式free
价格说明开源免费,npm包可自由使用
访问状态
是否开源
开源协议Apache-2.0
主要语言TypeScript
技术栈/模型tag-non-production
GitHub 星标★ 343
30天Star增速
HF 下载量
上线时间2025-04-11 00:00:00
最近更新2026-09-17 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-14
浏览次数0

使用教程

核心亮点

  • 直接复用 Vitest 的 describe/it/expect 与并行执行,评测用例和单元测试同仓库同命令运行
  • 支持 watch 模式与报告器,改提示词后能立刻看到哪些评测挂掉,迭代反馈快
  • 对已有 Vitest 项目近乎零迁移成本,不需要引入独立的评测平台或额外服务

不足之处

  • 项目仍处早期,星标 342,API 和文档可能随版本变动
  • 评测数据集管理、打分器生态和可视化对比能力相对薄弱,复杂评测需自行补齐

适用场景

  • 给提示词模板做回归测试,防止改一处措辞导致其他场景回答退化
  • 在 CI 中对不同模型版本跑同一批评测用例,用通过率决定是否切换模型
  • RAG 或 Agent 链路开发时,把检索质量和最终回答质量一起纳入测试套件

替代项目

promptfoo、braintrust

项目介绍

vitest-evals 是一个评测安全领域的开源项目,官方简介:A vitest extension for running evals.。项目使用 TypeScript 开发,在 GitHub 上获得 342 星标。

上一篇:workshop

下一篇:convex-evals

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1516 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24