AWESOME-OCR-LLM

一张清单看懂大模型时代 OCR 怎么选

AWESOME-OCR-LLM 是一个聚焦“大语言模型时代的 OCR”的开源资源集合,系统整理了将 LLM 与多模态大模型应用于文字识别、文档解析、场景文本理解等任务的相关论文、模型、数据集与工具。它解决的核心问题是:传统 OCR 流水线(检测+识别+后处理)在复杂版面、手写体、低质量图像上泛化差,而新出现的 OCR-LLM 方案分散在大量论文和仓库中,研究者与工程师难以快速跟进。项目通过分类清单把 OCR 与大模型结合的工作集中呈现,覆盖通用文字识别、文档理解、表格/公式识别、多语言及端到端视觉文档问答等方向,方便按任务检索和对比。它本身不是可运行代码库,而是选型与研究入口,适合作为该交叉领域的地图,帮助快速定位代表方法与基准。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 718
维护状态 活跃
是否开源
定价模式 free

项目数据

分类计算机视觉
开发团队Yuliang-Liu
所属国家
官网地址
定价模式free
价格说明开源资源列表,免费使用
访问状态
是否开源
开源协议MIT
主要语言
技术栈/模型
GitHub 星标★ 718
30天Star增速
HF 下载量
上线时间2026-02-10 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

核心亮点

  • 按任务与模型类型分类整理,便于快速定位 OCR-LLM 代表工作
  • 覆盖文档解析、表格公式、多语言等细分方向,信息密度高
  • 持续收录新论文与开源实现,可作为该交叉领域的研究入口

不足之处

  • 本质是资源清单,不提供可直接运行的代码或统一评测
  • 项目语言标注未知,部分条目缺少维护状态与效果对比说明

适用场景

  • 调研 OCR 与大模型结合方案时快速建立全局认知
  • 为文档解析/票据识别项目做技术选型时查找候选模型
  • 撰写论文或技术分享时检索相关数据集与基准

替代项目

PaddleOCR、Umi-OCR

项目介绍

AWESOME-OCR-LLM 是一个计算机视觉领域的开源项目,官方简介:OCR in the Era of Large Language Models。项目使用 未知 开发,在 GitHub 上获得 715 星标。

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3995 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90893 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2035 2026-08-14