lmms-eval

一套工具搞定文本/图像/视频/音频模型评测,结果可复现

lmms-eval 是一个面向多模态大模型的一站式评测工具包,支持文本、图像、视频和音频任务的统一评估。它解决了多模态模型评测标准不一、任务分散、复现困难的问题,提供标准化的评测流程和丰富的基准测试集。核心能力包括:支持超过 100 个基准数据集(如 MMMU、MMBench、Video-MME 等),覆盖视觉问答、视频理解、音频识别等任务;提供统一的模型接口,兼容 HuggingFace 和 OpenAI API 格式的模型;支持多 GPU 并行加速和断点续跑;内置结果对比和可视化功能,方便研究者快速分析模型性能。该项目由 OpenCompass 团队维护,社区活跃,是当前多模态评测领域的重要基础设施。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4422
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队EvolvingLMMs-Lab
所属国家
定价模式free
价格说明开源评估工具,本地部署使用,完全免费
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型agi,audio-evaluation,benchmark,evaluation,large-language-models,llm-evaluation,multimodal,multimodal-evaluation,video-understanding,vision-language-model,vlm
GitHub 星标★ 4422
30天Star增速
HF 下载量
上线时间2024-03-07 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 7 步

环境要求

  • Python 环境(README 示例使用 uv 创建 Python 3.12 虚拟环境)
  • 已安装 uv 包管理工具
  • 运行 coco / refcoco / nocaps 等 caption 数据集时需要 java==1.8.0
  • 首次运行会从 HuggingFace 拉取模型权重,需要网络与磁盘空间

安装与启动步骤

  1. 1克隆仓库

    把 lmms-eval 源码拉到本地,后续安装都以该目录为根目录。

    git clone https://github.com/EvolvingLMMs-Lab/lmms-eval.git
  2. 2进入项目目录

    切换到刚克隆下来的仓库目录。

    cd lmms-eval
  3. 3安装依赖

    用 uv 以可编辑模式安装全部依赖(包含 all 可选依赖组),耗时较长请耐心等待。

    uv pip install -e ".[all]"
  4. 4(可选)虚拟环境安装

    若不想用可编辑安装,可用 uv venv 建环境并直接从 Git 安装;注意该方式下自定义 task yaml 需手动加入。

    uv venv --python 3.12
    source eval/bin/activate
    uv pip install git+https://github.com/EvolvingLMMs-Lab/lmms-eval.git
  5. 5(可选)安装 Java

    只在评测 coco、refcoco、nocaps 等 caption 数据集时需要 java 1.8.0 供 pycocoeval 使用。

    conda install openjdk=8
  6. 6(可选)安装 VILA 依赖

    仅当要评测 VILA 模型时才需要额外安装该依赖。

    pip install s2wrapper@git+https://github.com/bfshi/scaling_on_scales
  7. 7跑通首次评测

    用 Qwen2.5-VL-3B-Instruct 在 mme 任务上只跑 8 条样本,快速验证环境是否可用。

    python -m lmms_eval 
      --model qwen2_5_vl 
      --model_args pretrained=Qwen/Qwen2.5-VL-3B-Instruct 
      --tasks mme 
      --batch_size 1 
      --limit 8

关键配置

配置项必填说明示例
task是自定义任务在 YAML 中的任务名称my_benchmark
dataset_path是数据集在 HuggingFace 上的仓库路径my-org/my-dataset
test_split是指定用于评测的数据集切分test
output_type是任务输出类型,决定评测方式generate_until

如何确认成功

命令运行后终端打印出 metrics 指标,即表示环境安装与评测流程正常。

常见问题

Q:如何快速验证环境是否可用?

A:按 Quickstart 运行 mme 任务并加 --limit 8 只跑 8 条样本,终端打印出 metrics 就说明环境已就绪。

Q:评测 coco、refcoco、nocaps 时报 Java 相关错误怎么办?

A:这些 caption 数据集依赖 pycocoeval,需要 java 1.8.0。可用 conda install openjdk=8 安装,再用 java -version 确认版本。

Q:要评测 VILA 模型需要额外装什么?

A:需额外执行 pip install s2wrapper@git+https://github.com/bfshi/scaling_on_scales 安装该依赖。

Q:为什么复现出的结果与论文有小差异?

A:

Q:如何远程调用评测服务?

A:README 提供了 EvalClient 客户端,例如 EvalClient("http://eval-server:8000"),指向已启动的评测服务地址即可。

注意事项

  • 除可编辑安装外,也可用 uv venv --python 3.12 建虚拟环境后直接从 Git 安装
  • 从 Git 直接安装时,若使用自定义 task yaml 可能需要自行加入
  • 评测会下载 HuggingFace 模型与数据集,注意网络连通性与磁盘空间
  • 更完整的使用说明见 docs/getting-started/quickstart.md

核心亮点

  • 覆盖多模态全场景,支持 100+ 主流基准,省去自己找数据集的麻烦
  • 兼容 HuggingFace 和 OpenAI API 模型,接入简单,几行代码跑评测
  • 支持多 GPU 并行和断点续跑,评测大规模模型时省时省力

不足之处

  • 文档偏学术化,新手入门门槛较高,需要一定模型评测经验
  • 部分新基准的适配速度滞后,社区贡献依赖外部开发者

适用场景

  • 学术研究:对比不同多模态模型在统一基准上的性能
  • 模型开发:迭代过程中快速验证模型在标准任务上的效果
  • 企业选型:评估开源多模态模型是否满足业务场景需求

替代项目

OpenCompass、EleutherAI/lm-evaluation-harness、VLMEvalKit

项目介绍

lmms-eval 是评测安全领域的开源项目,由 EvolvingLMMs-Lab 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(4,422)位列前 10%,在评测安全分类的 466 个项目里位列前 6%。

近 41 天,它的 GitHub 星标从 4,360 增加到 4,422,净增 62。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。开源评估工具,本地部署使用,完全免费。

它主要面向的使用场景是:学术研究:对比不同多模态模型在统一基准上的性能。同类可对比的替代方案包括 OpenCompass、EleutherAI/lm-evaluation-harness、VLMEvalKit。

上一篇:crab

下一篇:LooGLE

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12