
EvalForge
给 AI 评测加回归门禁,指标一降 CI 就拦。
EvalForge 是一个面向 AI/LLM 应用的评测与质量门禁工具,用 Python 编写。它解决的核心问题是:团队在 CI 中评测模型或 RAG 系统时,评测结果往往依赖特定框架、难以对比、也无法自动阻断回归。EvalForge 把评测结果抽象为「评测器中立」的证据格式,不绑定某个评测库,任何评测器产出的结果都能统一收集。它提供基线回归门禁,把当前结果与历史基线比较,一旦指标下降就按阈值让 CI 失败,防止悄悄退化。输出支持 JSON、JUnit 和 SARIF 三种格式,JUnit 可直接接入常见 CI 测试报告,SARIF 能被 GitHub Code Scanning 等安全/质量平台消费,把评测失败像代码缺陷一样展示。整体定位是 MLOps 流水线里的评测证据层与质量闸门,适合需要把 LLM 评测纳入 GitHub Actions 等持续集成流程的团队。
项目数据
使用教程
核心亮点
- 评测器中立,不绑定 LangSmith、Ragas 等具体框架,已有评测结果可统一接入
- 基线回归门禁可配置阈值,指标退化直接让 CI 失败,防止悄悄变差
- 同时输出 JSON、JUnit、SARIF,能接入 GitHub Code Scanning 和常见 CI 报告面板
不足之处
- 项目较早期,星标仅 188,生态集成和长期维护稳定性待观察
- 自身不提供评测数据集或评测算法,需配合外部评测器使用
适用场景
- 在 GitHub Actions 中为 LLM 应用跑评测并阻断指标回归
- RAG 系统迭代时对比新旧版本回答质量,生成 SARIF 报告到代码扫描
- 把已有评测框架的输出统一成 JUnit,接入现有 CI 测试报告
替代项目
promptfoo、DeepEval、Ragas
项目介绍
下一篇:AI-Surface
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents