Eval 是评测安全领域的开源项目,由 ai-twinkle 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 448 个项目,GitHub 星标数为 116。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-16。
它主要面向的使用场景是:快速对比多个prompt或模型版本的评测得分。同类可对比的替代方案包括 lm-evaluation-harness、OpenCompass。

并行跑 LLM 评测,速度提升最高 17 倍
Eval 是一个面向大语言模型的高性能评测框架,核心卖点是并行 API 调用,官方宣称比顺序执行的评测工具快最多 17 倍。它解决的是传统评测脚本逐个样本串行请求、耗时过长的问题,让开发者能在更短时间内跑完大规模评测集。框架支持三类评测方式:box(答案框选/匹配)、math(数学题自动判分)以及 logit-based(基于模型输出概率的评估),覆盖了从开放问答到数学推理的常见场景。项目用 Python 编写,定位轻量,适合需要频繁迭代 prompt、模型或微调版本的研究与工程团队,把评测从几小时压缩到几分钟,从而加快实验反馈循环。
lm-evaluation-harness、OpenCompass
Eval 是评测安全领域的开源项目,由 ai-twinkle 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 448 个项目,GitHub 星标数为 116。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-16。
它主要面向的使用场景是:快速对比多个prompt或模型版本的评测得分。同类可对比的替代方案包括 lm-evaluation-harness、OpenCompass。
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents