EvalForge

给 AI 评测加回归门禁,指标一降 CI 就拦。

EvalForge 是一个面向 AI/LLM 应用的评测与质量门禁工具,用 Python 编写。它解决的核心问题是:团队在 CI 中评测模型或 RAG 系统时,评测结果往往依赖特定框架、难以对比、也无法自动阻断回归。EvalForge 把评测结果抽象为「评测器中立」的证据格式,不绑定某个评测库,任何评测器产出的结果都能统一收集。它提供基线回归门禁,把当前结果与历史基线比较,一旦指标下降就按阈值让 CI 失败,防止悄悄退化。输出支持 JSON、JUnit 和 SARIF 三种格式,JUnit 可直接接入常见 CI 测试报告,SARIF 能被 GitHub Code Scanning 等安全/质量平台消费,把评测失败像代码缺陷一样展示。整体定位是 MLOps 流水线里的评测证据层与质量闸门,适合需要把 LLM 评测纳入 GitHub Actions 等持续集成流程的团队。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 210
维护状态 活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队jsdhwfmax
所属国家
官网地址
定价模式free
价格说明开源免费,无在线服务
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型ai-evaluation,github-actions,junit,llm-evaluation,mlops,python,quality-gates,rag,sarif,testing
GitHub 星标★ 210
30天Star增速
HF 下载量
上线时间2026-08-24 00:00:00
最近更新2026-09-16 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-12
浏览次数0

使用教程

核心亮点

  • 评测器中立,不绑定 LangSmith、Ragas 等具体框架,已有评测结果可统一接入
  • 基线回归门禁可配置阈值,指标退化直接让 CI 失败,防止悄悄变差
  • 同时输出 JSON、JUnit、SARIF,能接入 GitHub Code Scanning 和常见 CI 报告面板

不足之处

  • 项目较早期,星标仅 188,生态集成和长期维护稳定性待观察
  • 自身不提供评测数据集或评测算法,需配合外部评测器使用

适用场景

  • 在 GitHub Actions 中为 LLM 应用跑评测并阻断指标回归
  • RAG 系统迭代时对比新旧版本回答质量,生成 SARIF 报告到代码扫描
  • 把已有评测框架的输出统一成 JUnit,接入现有 CI 测试报告

替代项目

promptfoo、DeepEval、Ragas

项目介绍

EvalForge 是一个评测安全领域的开源项目,官方简介:Evaluator-neutral AI evaluation evidence, baseline regression gates, and JSON, JUnit, and SARIF reports for CI.。项目使用 Python 开发,在 GitHub 上获得 188 星标。

上一篇:skills-benchmarks

下一篇:AI-Surface

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24