MultimodalOCR

用29项细粒度任务,测出多模态大模型的OCR真实水平

MultimodalOCR 是 OCRBench 的官方开源实现,聚焦于评测大型多模态模型(LMM)在 OCR 任务上的真实能力。项目通过构建覆盖文本识别、场景文本 VQA、文档理解、关键信息抽取、手写识别等五大类共 29 个子任务的基准,系统性地揭示当前多模态模型在文字感知与理解上的短板。它解决的核心问题是:现有 OCR 评测多局限于传统模型或单一场景,缺乏对通用多模态大模型 OCR 能力的统一、细粒度衡量标准。项目提供完整评测代码、数据准备脚本和模型接入接口,支持对 GPT-4V、Gemini、Qwen-VL 等主流模型进行标准化打分,并输出细分维度的能力雷达图,帮助研究者和开发者定位模型弱项,指导后续训练与选型。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 894
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类计算机视觉
开发团队Yuliang-Liu
所属国家
官网地址
定价模式free
价格说明开源免费,无在线服务
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型
GitHub 星标★ 894
30天Star增速
HF 下载量
上线时间2023-05-12 00:00:00
最近更新2026-09-25 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-29
浏览次数0

使用教程

核心亮点

  • 覆盖29个OCR子任务,从文字识别到文档理解,评测维度全面
  • 提供统一评测框架和模型接入接口,可复现对比GPT-4V、Gemini等主流模型
  • 官方持续维护,基准结果公开透明,便于追踪多模态OCR能力演进

不足之处

  • 评测依赖外部模型API,本地复现需自行准备权重和推理环境,门槛较高
  • 部分子任务数据未完全开源,需申请或按脚本自行生成,增加使用成本

适用场景

  • 多模态大模型选型时,横向对比不同模型的OCR能力
  • OCR相关研究论文中,作为标准基准报告模型性能
  • 指导模型训练时,定位OCR弱项并针对性优化数据配比

替代项目

MMBench、SEED-Bench、OCR-VQA

项目介绍

MultimodalOCR 是计算机视觉领域的开源项目,由 Yuliang-Liu 开发,2023 年首次发布。

在全站 13,276 个收录项目中,它的 GitHub 星标数(894)位列前 30%,在计算机视觉分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-25。开源免费,无在线服务。

它主要面向的使用场景是:多模态大模型选型时,横向对比不同模型的OCR能力。同类可对比的替代方案包括 MMBench、SEED-Bench、OCR-VQA。

上一篇:OpenOCR

下一篇:light-ocr

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4045 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90972 2026-08-10
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1431 2026-08-20