every_eval_ever 是评测安全领域的开源项目,由 evaleval 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 448 个项目,GitHub 星标数为 118。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-17。开源共享评测数据库,免费使用。
它主要面向的使用场景是:评测平台汇总多个榜单结果做横向对比。同类可对比的替代方案包括 HELM、lm-evaluation-harness。

把散落各处的 AI 评测结果统一成可比较的公共数据库
Every Eval Ever 是一个面向 AI 评测领域的共享元数据规范与众包评测数据库。它要解决的核心问题是:当前 AI 评测结果散落在各类排行榜、学术论文和本地评测脚本中,格式各异、字段不统一,导致不同框架产出的结果难以横向比较、复现和复用。项目定义了一套标准化的元数据格式,用来统一存储 AI 评测结果,覆盖从排行榜抓取、论文数据到本地评测运行等多种来源。配套的众包数据库让社区可以提交和共享评测记录,从而逐步积累成一个可检索、可对比的公共评测档案。核心能力包括:统一 schema 定义、结果来源标注、跨框架结果对齐,以及面向复现的元数据留存。项目用 Python 实现,定位偏向评测基础设施层,适合评测平台、模型团队和研究者作为数据交换的公共约定使用。
HELM、lm-evaluation-harness
every_eval_ever 是评测安全领域的开源项目,由 evaleval 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 448 个项目,GitHub 星标数为 118。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-17。开源共享评测数据库,免费使用。
它主要面向的使用场景是:评测平台汇总多个榜单结果做横向对比。同类可对比的替代方案包括 HELM、lm-evaluation-harness。
上一篇:evalstats
下一篇:benchmark-radar
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents