Video-MME-v2

评测视频大模型,从看懂片段到理解长视频全场景。

Video-MME-v2 是一个面向全面视频理解的新一代评测基准项目。它旨在解决现有视频理解基准在任务多样性、视频长度覆盖和评估维度上的不足,推动视频大模型从简单片段识别走向复杂、长时间、多模态内容的深度理解。项目核心能力包括:构建大规模、多场景的视频评测数据集,覆盖短、中、长视频;设计多模态(视觉、音频、文本)联合理解任务;提供标准化评估协议和自动化打分脚本,支持主流视频理解模型的横向对比。通过细粒度的能力维度拆解(如时序推理、空间关系、事件因果等),帮助研究者定位模型短板,加速视频理解技术的迭代。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 370
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队MME-Benchmarks
所属国家
定价模式free
价格说明开源项目,无在线服务,需自行部署,完全免费。
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型large-language-models,large-vision-language-models,multimodal-large-language-models,video,video-mme
GitHub 星标★ 370
30天Star增速
HF 下载量
上线时间2026-04-03 00:00:00
最近更新2026-09-22 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 评测维度覆盖全面,从短到长视频、多模态联合理解,能精准暴露模型短板。
  • 提供标准化评估脚本和协议,模型对比结果可复现,省去自建评测流程。
  • 数据集设计贴近真实应用场景(如监控、影视、教育),实用性强。

不足之处

  • 项目处于早期阶段,文档和社区支持尚待完善。
  • 数据集规模可能有限,对超长视频(如1小时以上)的覆盖有待验证。

适用场景

  • 学术研究:对比不同视频理解模型在统一基准上的性能。
  • 模型开发:定位自家模型在时序推理、多模态融合等维度的不足。
  • 技术选型:企业评估候选视频理解模型时,作为客观参考依据。

替代项目

Video-MME、LVBench、Video-Bench

项目介绍

Video-MME-v2 是评测安全领域的开源项目,由 MME-Benchmarks 开发,是 2026 年新上线的项目。

它收录于评测安全分类,该分类目前共有 467 个项目,GitHub 星标数为 370。

项目仍在小幅维护中,最近一次代码更新于 2026-09-22。无在线服务,需自行部署,完全免费。

它主要面向的使用场景是:学术研究:对比不同视频理解模型在统一基准上的性能。同类可对比的替代方案包括 Video-MME、LVBench、Video-Bench。

上一篇:LooGLE

下一篇:fusion_bench

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12