
One-Eval
用 agent 自动跑完 LLM 评测全流程,省去手工配数据与打分
One-Eval 是一个面向大语言模型评测的自动化系统,核心思路是用 agent 来驱动整个评测流程。传统 LLM 评测往往需要人工配置数据集、编写推理脚本、跑分、汇总结果,步骤繁琐且容易出错。该项目把这些环节交给智能体编排:自动选择或加载 benchmark 数据、调用 vLLM 或 SGLang 等推理后端批量生成模型回答、再借助数据分析能力完成打分与结果汇总。它解决的是评测流程碎片化、重复劳动多、难以规模化的问题,让研究者用更少的手工操作获得可复现的模型对比结果。技术栈以 Python 为主,结合 agent、benchmark、data-analysis 等模块,适合需要频繁横向对比多个 LLM 的团队。
项目数据
使用教程
核心亮点
- 用 agent 编排评测全流程,减少人工配置数据集和推理脚本的重复劳动
- 集成 vLLM、SGLang 等主流推理后端,便于批量高效生成模型回答
- 覆盖 benchmark 加载、推理、数据分析与结果汇总,形成端到端闭环
不足之处
- 项目处于早期阶段,星标数较少,生态与文档完善度待观察
- 评测结果的可信度依赖 agent 编排逻辑,复杂任务的稳定性需实际验证
适用场景
- 团队需要定期横向对比多个 LLM 在标准 benchmark 上的表现
- 研究者快速验证新模型或微调版本的能力变化
- 工程团队搭建自动化模型评测流水线,减少手工跑分
替代项目
lm-evaluation-harness、OpenCompass
项目介绍
上一篇:Awesome-Multimodal-LLM-for-Code
下一篇:Eval
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents