every_eval_ever

把散落各处的 AI 评测结果统一成可比较的公共数据库

Every Eval Ever 是一个面向 AI 评测领域的共享元数据规范与众包评测数据库。它要解决的核心问题是:当前 AI 评测结果散落在各类排行榜、学术论文和本地评测脚本中,格式各异、字段不统一,导致不同框架产出的结果难以横向比较、复现和复用。项目定义了一套标准化的元数据格式,用来统一存储 AI 评测结果,覆盖从排行榜抓取、论文数据到本地评测运行等多种来源。配套的众包数据库让社区可以提交和共享评测记录,从而逐步积累成一个可检索、可对比的公共评测档案。核心能力包括:统一 schema 定义、结果来源标注、跨框架结果对齐,以及面向复现的元数据留存。项目用 Python 实现,定位偏向评测基础设施层,适合评测平台、模型团队和研究者作为数据交换的公共约定使用。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 118
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队evaleval
所属国家
定价模式free
价格说明开源共享评测数据库,免费使用
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型agent-evaluation,ai-evaluation,evaluations,infra,llm-evaluation
GitHub 星标★ 118
30天Star增速
HF 下载量
上线时间2025-10-08 00:00:00
最近更新2026-09-17 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-14
浏览次数0

使用教程

核心亮点

  • 定义统一元数据 schema,让不同评测框架的结果可以对齐比较
  • 支持排行榜抓取、论文数据和本地评测多种来源,覆盖面广
  • 众包数据库模式,社区可持续贡献并积累公共评测档案

不足之处

  • 项目处于早期,星标仅 112,生态和采用度有待观察
  • 众包数据的质量与一致性依赖社区维护,缺少强校验机制说明

适用场景

  • 评测平台汇总多个榜单结果做横向对比
  • 研究者在论文中发布可复现的评测元数据
  • 模型团队统一记录本地评测运行结果以便追踪

替代项目

HELM、lm-evaluation-harness

项目介绍

every_eval_ever 是评测安全领域的开源项目,由 evaleval 开发,2025 年首次发布。

它收录于评测安全分类,该分类目前共有 448 个项目,GitHub 星标数为 118。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-17。开源共享评测数据库,免费使用。

它主要面向的使用场景是:评测平台汇总多个榜单结果做横向对比。同类可对比的替代方案包括 HELM、lm-evaluation-harness。

上一篇:evalstats

下一篇:benchmark-radar

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24