MultimodalOCR 是计算机视觉领域的开源项目,由 Yuliang-Liu 开发,2023 年首次发布。
在全站 13,276 个收录项目中,它的 GitHub 星标数(894)位列前 30%,在计算机视觉分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-25。开源免费,无在线服务。
它主要面向的使用场景是:多模态大模型选型时,横向对比不同模型的OCR能力。同类可对比的替代方案包括 MMBench、SEED-Bench、OCR-VQA。

用29项细粒度任务,测出多模态大模型的OCR真实水平
MultimodalOCR 是 OCRBench 的官方开源实现,聚焦于评测大型多模态模型(LMM)在 OCR 任务上的真实能力。项目通过构建覆盖文本识别、场景文本 VQA、文档理解、关键信息抽取、手写识别等五大类共 29 个子任务的基准,系统性地揭示当前多模态模型在文字感知与理解上的短板。它解决的核心问题是:现有 OCR 评测多局限于传统模型或单一场景,缺乏对通用多模态大模型 OCR 能力的统一、细粒度衡量标准。项目提供完整评测代码、数据准备脚本和模型接入接口,支持对 GPT-4V、Gemini、Qwen-VL 等主流模型进行标准化打分,并输出细分维度的能力雷达图,帮助研究者和开发者定位模型弱项,指导后续训练与选型。
MMBench、SEED-Bench、OCR-VQA
MultimodalOCR 是计算机视觉领域的开源项目,由 Yuliang-Liu 开发,2023 年首次发布。
在全站 13,276 个收录项目中,它的 GitHub 星标数(894)位列前 30%,在计算机视觉分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-25。开源免费,无在线服务。
它主要面向的使用场景是:多模态大模型选型时,横向对比不同模型的OCR能力。同类可对比的替代方案包括 MMBench、SEED-Bench、OCR-VQA。
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档