MMMU

用大学级多模态考题,测出 AI 的真实专家水平

MMMU 是一个大规模多学科多模态理解与推理基准测试集,旨在评估和推动 AI 模型在专家级通用人工智能(AGI)方向上的能力。它包含来自艺术、工程、科学等六大领域的海量大学水平问题,每个问题均配有图像和文本,要求模型进行跨模态的深度理解与推理。该项目提供完整的评估代码,支持对主流多模态大模型(如 GPT-4V、LLaVA 等)进行标准化测试,并输出细粒度的学科能力报告。核心价值在于为研究者提供一套严格、可复现的评测工具,帮助识别模型在专业学科上的短板,从而引导模型向专家级推理能力进化。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 598
维护状态 维护中
是否开源
定价模式 free

项目数据

分类开源模型
开发团队MMMU-Benchmark
所属国家
定价模式free
价格说明开源评估代码,完全免费,无付费版本。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型computer-vision,deep-learning,deep-neural-networks,evaluation,foundation-models,large-language-models,large-multimodal-models,llm,llms,machine-learning,multimodal,multimodal-deep-learning,multimodal-learning,multimodality,natural-language-processing,question-answering,stem,visual-question-answering
GitHub 星标★ 598
30天Star增速
HF 下载量
上线时间2023-11-23 00:00:00
最近更新2026-09-18 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 覆盖六大专业领域,题目源自真实大学考试,难度高且贴近实际应用
  • 提供标准化评估脚本,支持多模型对比,结果可复现性强
  • 细粒度学科报告,能精准定位模型在特定学科上的能力短板

不足之处

  • 项目仅提供评估代码,不包含训练数据或模型,需自行准备模型权重
  • 文档和社区支持尚不完善,新手上手可能有一定门槛

适用场景

  • 多模态大模型研发团队进行模型能力横向评测
  • 学术机构用于研究 AI 在专业学科上的推理边界
  • 企业选型多模态模型时,作为专业场景的验证工具

替代项目

MMBench、SEED-Bench、MM-Vet

项目介绍

MMMU 是评测安全领域的开源项目,由 MMMU-Benchmark 开发,2023 年首次发布。

它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 598。

项目仍在小幅维护中,最近一次代码更新于 2026-09-18。开源评估代码,完全免费,无付费版本。

它主要面向的使用场景是:多模态大模型研发团队进行模型能力横向评测。同类可对比的替代方案包括 MMBench、SEED-Bench、MM-Vet。

上一篇:langtest

下一篇:MathVista

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1362 2026-08-24