Eval

并行跑 LLM 评测,速度提升最高 17 倍

Eval 是一个面向大语言模型的高性能评测框架,核心卖点是并行 API 调用,官方宣称比顺序执行的评测工具快最多 17 倍。它解决的是传统评测脚本逐个样本串行请求、耗时过长的问题,让开发者能在更短时间内跑完大规模评测集。框架支持三类评测方式:box(答案框选/匹配)、math(数学题自动判分)以及 logit-based(基于模型输出概率的评估),覆盖了从开放问答到数学推理的常见场景。项目用 Python 编写,定位轻量,适合需要频繁迭代 prompt、模型或微调版本的研究与工程团队,把评测从几小时压缩到几分钟,从而加快实验反馈循环。

开源 unknown 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 116
维护状态 活跃
是否开源
定价模式 unknown

项目数据

分类评测安全
开发团队ai-twinkle
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型eval,evaluation,llm
GitHub 星标★ 116
30天Star增速
HF 下载量
上线时间2025-03-31 00:00:00
最近更新2026-09-16 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

核心亮点

  • 并行 API 调用,显著缩短大规模评测集的总耗时
  • 同时支持 box、math、logit 三类评测,覆盖问答与数学推理
  • 纯 Python 实现,接入现有评测流程成本低

不足之处

  • 项目处于早期,星标仅 110,生态与文档成熟度有待观察
  • 并行调用对 API 限流和成本控制提出更高要求,缺少明确说明

适用场景

  • 快速对比多个 prompt 或模型版本的评测得分
  • 批量跑数学推理基准并自动判分
  • 在微调迭代中频繁执行回归评测

替代项目

lm-evaluation-harness、OpenCompass

项目介绍

Eval 是评测安全领域的开源项目,由 ai-twinkle 开发,2025 年首次发布。

它收录于评测安全分类,该分类目前共有 448 个项目,GitHub 星标数为 116。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-16。

它主要面向的使用场景是:快速对比多个prompt或模型版本的评测得分。同类可对比的替代方案包括 lm-evaluation-harness、OpenCompass。

上一篇:One-Eval

下一篇:tribunal

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24