evalscope

一键评测大模型,性能基准轻松跑

evalscope 是一个面向大语言模型(LLM)、视觉语言模型(VLM)和生成式 AI(AIGC)的评估与性能基准测试框架。它旨在解决模型评测流程繁琐、标准不一、复现困难等问题,提供统一、可定制且高效的评测体验。核心能力包括:支持多种主流评测基准(如 MMLU、C-Eval 等)和自定义数据集;提供分布式评测能力,可加速大规模模型测试;内置结果可视化与报告生成,便于对比分析;支持模型 API 和本地模型接入,灵活适配不同场景。通过简洁的配置和命令行接口,用户能快速启动评测任务,并集成到 CI/CD 流程中,实现模型质量的持续监控。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3464
维护状态 活跃
是否开源
定价模式 free

项目数据

分类搜索知识
开发团队modelscope
所属国家
定价模式free
价格说明开源框架,Apache-2.0 许可证,可免费使用和自部署,无在线服务。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型evaluation,llm,performance,rag,vlm
GitHub 星标★ 3464
30天Star增速
HF 下载量
上线时间2023-12-07 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:入门 约 5 分钟 部署方式:库/依赖 3 步

环境要求

  • 已安装 Python 环境
  • pip 可用并能访问 PyPI
  • 如需源码安装或额外依赖,需参考官方安装指南

安装与启动步骤

  1. 1确认 Python 环境

    确保本机已装好 Python 且 pip 可正常使用,这是后续安装 evalscope 的前置条件。

    python --version
    pip --version
  2. 2安装 evalscope

    README 的 Quick Start 只给出一条安装方式:直接用 pip 从 PyPI 安装 evalscope 包。

    pip install evalscope
  3. 3查阅官方文档

    README 未给出评测命令示例,安装后请到官方安装指南与文档页查看源码安装、额外依赖及实际评测用法。

如何确认成功

运行 pip show evalscope 能显示已安装的版本号与安装路径,即表示安装成功。

常见问题

Q:需要源码安装或安装额外依赖怎么办?

A:README 明确说明详细安装方式(源码安装、额外依赖等)请参考官方安装指南:https://evalscope.readthedocs.io/en/latest/get_started/installation.html

Q:安装后不知道怎么开始评测?

A:README 的 Quick Start 只包含 pip 安装步骤,具体评测用法请查阅中文文档 https://evalscope.readthedocs.io/zh-cn/latest/ 或产品官网。

Q:文档在哪里看?

A:中文文档:https://evalscope.readthedocs.io/zh-cn/latest/;英文文档:https://evalscope.readthedocs.io/en/latest/;官网:https://modelscope.github.io/evalscope/

注意事项

  • README 未提供评测运行的命令行示例,实际使用前建议先通读官方文档,避免照搬猜测的参数。
  • 源码安装方式见官方 Installation Guide,不要自行猜测依赖包名。
  • 项目地址:https://github.com/modelscope/evalscope ,觉得有用可点 Star 支持。

核心亮点

  • 支持 LLM、VLM、AIGC 多种模型类型,覆盖范围广
  • 内置主流评测基准和自定义数据集,开箱即用
  • 分布式评测加速,适合大规模模型测试

不足之处

  • 文档/社区待观察
  • 自定义评测流程的学习曲线可能较陡

适用场景

  • 模型选型时对比不同大模型的性能
  • 模型迭代开发中持续回归测试
  • 研究机构或企业发布模型时的基准报告生成

替代项目

lm-evaluation-harness、OpenCompass、DeepEval

项目介绍

evalscope 是评测安全领域的开源项目,由 modelscope 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(3,464)位列前 30%,在评测安全分类的 458 个项目里位列前 8%。

近 42 天,它的 GitHub 星标从 3,230 增加到 3,464,净增 234。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0 许可证,可免费使用和自部署,无在线服务。

它主要面向的使用场景是:模型选型时对比不同大模型的性能。同类可对比的替代方案包括 lm-evaluation-harness、OpenCompass、DeepEval。

上一篇:WormGPT

下一篇:beir

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1362 2026-08-24