
DTrOCR
用纯解码器 Transformer 直接生成文字,简化 OCR 识别流程
DTrOCR 是论文《DTrOCR: Decoder-only Transformer for Optical Character Recognition》的 PyTorch 官方实现,把文本识别重新定义为纯解码器 Transformer 的自回归生成任务。传统 OCR 通常依赖 CNN 特征提取加 CTC 或编码器-解码器结构,而该项目直接用解码器 Transformer 逐字符生成识别结果,简化了整体架构。核心能力包括:支持场景文本与手写文本识别、可加载预训练权重进行推理、提供训练与评估脚本、兼容常见 OCR 数据集格式。对研究者而言,它提供了一个结构简洁、易于修改的基线,方便对比不同解码策略与预训练方案;对工程实践者,可用来快速验证解码器-only 架构在特定语料上的效果。项目代码量不大,依赖 PyTorch,适合作为 OCR 方向论文复现与二次开发的起点。
项目数据
使用教程
核心亮点
- 架构简洁,去掉编码器和 CTC,仅用解码器 Transformer 自回归出字符
- 提供完整训练与推理脚本,可直接在常见 OCR 数据集上复现论文结果
- 基于 PyTorch 实现,代码可读性高,便于研究者修改和做消融实验
不足之处
- 项目处于早期阶段,星标和社区规模较小,长期维护情况待观察
- 自回归解码推理速度通常慢于 CTC 类方法,长文本场景效率可能受限
适用场景
- 学术研究中复现 decoder-only OCR 论文并对比不同识别架构
- 在自定义场景文本或手写数据集上微调识别模型
- 作为教学示例,帮助理解 Transformer 解码器在 OCR 任务中的应用
替代项目
PaddleOCR、MMOCR
项目介绍
上一篇:PPOCRLabel
下一篇:GutenOCR
同类项目推荐
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3