
AWESOME-OCR-LLM
一张清单看懂大模型时代 OCR 怎么选
AWESOME-OCR-LLM 是一个聚焦“大语言模型时代的 OCR”的开源资源集合,系统整理了将 LLM 与多模态大模型应用于文字识别、文档解析、场景文本理解等任务的相关论文、模型、数据集与工具。它解决的核心问题是:传统 OCR 流水线(检测+识别+后处理)在复杂版面、手写体、低质量图像上泛化差,而新出现的 OCR-LLM 方案分散在大量论文和仓库中,研究者与工程师难以快速跟进。项目通过分类清单把 OCR 与大模型结合的工作集中呈现,覆盖通用文字识别、文档理解、表格/公式识别、多语言及端到端视觉文档问答等方向,方便按任务检索和对比。它本身不是可运行代码库,而是选型与研究入口,适合作为该交叉领域的地图,帮助快速定位代表方法与基准。
开源
free
计算机视觉
GitHub 星标
★ 718
维护状态
活跃
是否开源
是
定价模式
free
项目数据
分类计算机视觉
开发团队Yuliang-Liu
所属国家
定价模式free
价格说明开源资源列表,免费使用
访问状态
是否开源是
开源协议MIT
主要语言
技术栈/模型
GitHub 星标★ 718
30天Star增速
HF 下载量
上线时间2026-02-10 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0
使用教程
核心亮点
- 按任务与模型类型分类整理,便于快速定位 OCR-LLM 代表工作
- 覆盖文档解析、表格公式、多语言等细分方向,信息密度高
- 持续收录新论文与开源实现,可作为该交叉领域的研究入口
不足之处
- 本质是资源清单,不提供可直接运行的代码或统一评测
- 项目语言标注未知,部分条目缺少维护状态与效果对比说明
适用场景
- 调研 OCR 与大模型结合方案时快速建立全局认知
- 为文档解析/票据识别项目做技术选型时查找候选模型
- 撰写论文或技术分享时检索相关数据集与基准
替代项目
PaddleOCR、Umi-OCR
项目介绍
同类项目推荐
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3