One-Eval

用 agent 自动跑完 LLM 评测全流程,省去手工配数据与打分

One-Eval 是一个面向大语言模型评测的自动化系统,核心思路是用 agent 来驱动整个评测流程。传统 LLM 评测往往需要人工配置数据集、编写推理脚本、跑分、汇总结果,步骤繁琐且容易出错。该项目把这些环节交给智能体编排:自动选择或加载 benchmark 数据、调用 vLLM 或 SGLang 等推理后端批量生成模型回答、再借助数据分析能力完成打分与结果汇总。它解决的是评测流程碎片化、重复劳动多、难以规模化的问题,让研究者用更少的手工操作获得可复现的模型对比结果。技术栈以 Python 为主,结合 agent、benchmark、data-analysis 等模块,适合需要频繁横向对比多个 LLM 的团队。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 164
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队OpenDCAI
所属国家
定价模式free
价格说明开源项目,免费使用,定价信息待确认
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型agent,agents,benchmark,data,data-analysis,data-science,evaluation,llm,llms,sglang,vllm
GitHub 星标★ 164
30天Star增速
HF 下载量
上线时间2025-11-10 00:00:00
最近更新2026-09-15 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

核心亮点

  • 用 agent 编排评测全流程,减少人工配置数据集和推理脚本的重复劳动
  • 集成 vLLM、SGLang 等主流推理后端,便于批量高效生成模型回答
  • 覆盖 benchmark 加载、推理、数据分析与结果汇总,形成端到端闭环

不足之处

  • 项目处于早期阶段,星标数较少,生态与文档完善度待观察
  • 评测结果的可信度依赖 agent 编排逻辑,复杂任务的稳定性需实际验证

适用场景

  • 团队需要定期横向对比多个 LLM 在标准 benchmark 上的表现
  • 研究者快速验证新模型或微调版本的能力变化
  • 工程团队搭建自动化模型评测流水线,减少手工跑分

替代项目

lm-evaluation-harness、OpenCompass

项目介绍

One-Eval 是一个评测安全领域的开源项目,官方简介:Automated system for LLM evaluation via agents. Doc as below:。项目使用 Python 开发,在 GitHub 上获得 165 星标。

上一篇:Awesome-Multimodal-LLM-for-Code

下一篇:Eval

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24