
vitest-evals
用 Vitest 写 LLM 评测,像跑单测一样跑模型回归
vitest-evals 是一个把大模型评测(evals)直接嵌入 Vitest 测试框架的 TypeScript 扩展。它解决的问题是:传统上跑 LLM 评测要另起一套脚本、单独管理数据集和评分逻辑,和项目现有的测试流程割裂。这个项目让你用熟悉的 describe/it/expect 写法定义评测用例,把模型输出当作断言对象,从而复用 Vitest 的并行执行、watch 模式、报告器和 CI 集成。核心能力包括:在测试文件中声明评测任务、对模型回答做结构化断言、支持打分函数与阈值判断,并借助 Vitest 生态输出可读的通过/失败结果。它适合已经在用 Vitest 的前端或 Node 团队,用最低迁移成本给提示词、模型版本或 RAG 链路建立回归测试,把评测变成日常开发的一部分,而不是上线前临时补的一次性工作。
项目数据
使用教程
核心亮点
- 直接复用 Vitest 的 describe/it/expect 与并行执行,评测用例和单元测试同仓库同命令运行
- 支持 watch 模式与报告器,改提示词后能立刻看到哪些评测挂掉,迭代反馈快
- 对已有 Vitest 项目近乎零迁移成本,不需要引入独立的评测平台或额外服务
不足之处
- 项目仍处早期,星标 342,API 和文档可能随版本变动
- 评测数据集管理、打分器生态和可视化对比能力相对薄弱,复杂评测需自行补齐
适用场景
- 给提示词模板做回归测试,防止改一处措辞导致其他场景回答退化
- 在 CI 中对不同模型版本跑同一批评测用例,用通过率决定是否切换模型
- RAG 或 Agent 链路开发时,把检索质量和最终回答质量一起纳入测试套件
替代项目
promptfoo、braintrust
项目介绍
上一篇:workshop
下一篇:convex-evals
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents