DTrOCR

用纯解码器 Transformer 直接生成文字,简化 OCR 识别流程

DTrOCR 是论文《DTrOCR: Decoder-only Transformer for Optical Character Recognition》的 PyTorch 官方实现,把文本识别重新定义为纯解码器 Transformer 的自回归生成任务。传统 OCR 通常依赖 CNN 特征提取加 CTC 或编码器-解码器结构,而该项目直接用解码器 Transformer 逐字符生成识别结果,简化了整体架构。核心能力包括:支持场景文本与手写文本识别、可加载预训练权重进行推理、提供训练与评估脚本、兼容常见 OCR 数据集格式。对研究者而言,它提供了一个结构简洁、易于修改的基线,方便对比不同解码策略与预训练方案;对工程实践者,可用来快速验证解码器-only 架构在特定语料上的效果。项目代码量不大,依赖 PyTorch,适合作为 OCR 方向论文复现与二次开发的起点。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 206
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类计算机视觉
开发团队arvindrajan92
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型decoder,dtrocr,ocr,pytorch,recognition,text-recognition,transformer
GitHub 星标★ 206
30天Star增速
HF 下载量
上线时间2024-07-13 00:00:00
最近更新2026-09-14 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0

使用教程

核心亮点

  • 架构简洁,去掉编码器和 CTC,仅用解码器 Transformer 自回归出字符
  • 提供完整训练与推理脚本,可直接在常见 OCR 数据集上复现论文结果
  • 基于 PyTorch 实现,代码可读性高,便于研究者修改和做消融实验

不足之处

  • 项目处于早期阶段,星标和社区规模较小,长期维护情况待观察
  • 自回归解码推理速度通常慢于 CTC 类方法,长文本场景效率可能受限

适用场景

  • 学术研究中复现 decoder-only OCR 论文并对比不同识别架构
  • 在自定义场景文本或手写数据集上微调识别模型
  • 作为教学示例,帮助理解 Transformer 解码器在 OCR 任务中的应用

替代项目

PaddleOCR、MMOCR

项目介绍

DTrOCR 是一个计算机视觉领域的开源项目,官方简介:A PyTorch implementation of DTrOCR: Decoder-only Transformer for Optical Character Recognition。项目使用 Python 开发,在 GitHub 上获得 206 星标。

上一篇:PPOCRLabel

下一篇:GutenOCR

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3973 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90860 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2032 2026-08-14