PPOCRLabel

内置OCR预识别,拉框改字就能产出训练数据

PPOCRLabel 是飞桨 OCR 生态中的半自动图形标注工具,专为 OCR 数据集制作而设计。它内置 PP-OCR 模型,可自动检测文本框并识别文字内容,用户只需对结果进行修正和确认,大幅减少手工拉框、逐字录入的工作量。工具支持矩形框、四点框、多边形等多种标注形式,覆盖检测与识别两类任务,并可将标注结果一键导出为 PP-OCR 训练所需的格式,直接用于模型微调。界面基于 PyQt 实现,提供快捷键操作、图片列表管理、标注文件导入导出等功能,适合中小规模 OCR 数据集的快速构建。对于需要针对特定场景(如票据、证件、工业字符)训练识别模型的团队,它把标注、预识别、格式转换串成一条流水线,是飞桨 OCR 工具链中衔接数据与训练的关键一环。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 449
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类计算机视觉
开发团队PFCCLab
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署使用
访问状态
是否开源
开源协议
主要语言Python
技术栈/模型
GitHub 星标★ 449
30天Star增速
HF 下载量
上线时间2024-05-13 00:00:00
最近更新2026-09-15 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0

使用教程

核心亮点

  • 内置 PP-OCR 模型自动检测并预识别,人工只需修正,标注效率明显高于纯手工工具
  • 支持矩形、四点、多边形等多种框型,检测与识别标注可在同一界面完成
  • 导出格式直接对接 PP-OCR 训练流程,标注完即可用于微调,链路完整

不足之处

  • 依赖飞桨和 PP-OCR 环境,安装配置对非深度学习用户有一定门槛
  • 界面与交互相对朴素,复杂版面或密集小文字的修正体验一般

适用场景

  • 为特定行业场景(票据、证件、表单)制作 OCR 微调数据集
  • 对已有 OCR 识别结果做人工校对与标注修正
  • 教学或竞赛中快速构建小规模 OCR 训练与测试数据

替代项目

LabelImg、PPOCRLabel 同类:Labelme、PaddleOCR 生态外的:EasyOCR 配套标注工具

项目介绍

PPOCRLabel 是一个计算机视觉领域的开源项目,官方简介:PPOCRLabelv3 is a semi-automatic graphic annotation tool suitable for OCR field, with built-in PP-OCR model to automatically detect and re-recognize data.。项目使用 Python 开发,在 GitHub 上获得 449 星标。

上一篇:vietnamese-ocr-toolbox

下一篇:DTrOCR

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3973 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90860 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2032 2026-08-14