MMMU 是评测安全领域的开源项目,由 MMMU-Benchmark 开发,2023 年首次发布。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 598。
项目仍在小幅维护中,最近一次代码更新于 2026-09-18。开源评估代码,完全免费,无付费版本。
它主要面向的使用场景是:多模态大模型研发团队进行模型能力横向评测。同类可对比的替代方案包括 MMBench、SEED-Bench、MM-Vet。

用大学级多模态考题,测出 AI 的真实专家水平
MMMU 是一个大规模多学科多模态理解与推理基准测试集,旨在评估和推动 AI 模型在专家级通用人工智能(AGI)方向上的能力。它包含来自艺术、工程、科学等六大领域的海量大学水平问题,每个问题均配有图像和文本,要求模型进行跨模态的深度理解与推理。该项目提供完整的评估代码,支持对主流多模态大模型(如 GPT-4V、LLaVA 等)进行标准化测试,并输出细粒度的学科能力报告。核心价值在于为研究者提供一套严格、可复现的评测工具,帮助识别模型在专业学科上的短板,从而引导模型向专家级推理能力进化。
MMBench、SEED-Bench、MM-Vet
MMMU 是评测安全领域的开源项目,由 MMMU-Benchmark 开发,2023 年首次发布。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 598。
项目仍在小幅维护中,最近一次代码更新于 2026-09-18。开源评估代码,完全免费,无付费版本。
它主要面向的使用场景是:多模态大模型研发团队进行模型能力横向评测。同类可对比的替代方案包括 MMBench、SEED-Bench、MM-Vet。
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···