PaddleOCR

把图片和 PDF 变成 AI 能用的结构化文本数据

PaddleOCR 是百度开源的 OCR 工具库,旨在将任意 PDF 或图片文档转化为结构化数据,供 AI 系统使用。它解决了图像和 PDF 中文字信息难以被机器读取和利用的问题,为 LLM 应用提供高质量文本输入。核心能力包括:支持 100+ 语言的文字识别、文档解析、版面分析、关键信息抽取(KIE)、文档翻译以及 PDF 转 Markdown 等。基于 PaddlePaddle 深度学习框架,提供轻量级模型,兼顾精度与速度。其模块化设计支持从文本检测、方向分类到识别、后处理的完整流水线,并内置丰富的预训练模型和工具,便于快速集成到 RAG 等 AI 工作流中。

开源 unknown 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 90032
维护状态 活跃
是否开源
定价模式 unknown

项目数据

分类搜索知识
开发团队PaddlePaddle
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型ai4science,chineseocr,document-parsing,document-translation,kie,ocr,paddleocr-vl,pdf-extractor-rag,pdf-parser,pdf2markdown,pp-ocr,pp-structure,rag
GitHub 星标★ 90032
30天Star增速
HF 下载量
上线时间2020-05-08 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 本地 Python 环境(项目开发语言为 Python,README 未指定具体版本,请以官方文档为准)
  • 可访问官方文档站点 www.paddleocr.ai 与 GitHub 仓库
  • 根据使用场景准备 CPU 或 GPU 运行环境

安装与启动步骤

  1. 1明确使用场景

    先判断要用哪套能力:纯文字识别选 PP-OCR 系列,文档解析选 PaddleOCR-VL 系列,版面与表格结构化选 PP-StructureV3。

  2. 2查阅部署文档

    按上一步选择的结果打开 README 给出的对应官方文档链接,安装命令与依赖均以该文档为准。

  3. 3准备 Python 环境

    本项目为 Python 库,请先在本地准备好 Python 环境,具体版本与依赖要求参见官方文档的安装说明。

  4. 4完成安装并试跑

    依照官方文档安装框架与工具库,安装完成后用一张示例图片或 PDF 跑通识别流程。

如何确认成功

README 未给出验证命令;按官方文档完成安装后,用一张示例图片或 PDF 跑通识别流程并得到结构化输出即可。

常见问题

Q:README 里为什么没有安装命令?

A:本次节选只保留了 Quick Start 的“本地部署”部分,它直接指向官方文档,安装命令需到对应文档中查看。

Q:PP-OCR、PaddleOCR-VL、PP-StructureV3 怎么选?

A:要通用文字识别选 PP-OCR;要文档解析与 Markdown/JSON 输出选 PaddleOCR-VL;要带表格单元格等细粒度坐标的结构化转换选 PP-StructureV3。

Q:支持多少种语言?

A:项目简介标明支持 100+ 语言的文字识别,具体语言列表请查阅官方文档。

Q:必须联网吗?

A:查阅本文档链接与获取预训练模型需要联网,安装完成后的推理是否离线取决于所选模型与文档说明。

注意事项

  • README 节选未提供完整安装命令,请以官方文档为准,不要凭猜测执行未经文档确认的命令
  • 官方文档入口:https://www.paddleocr.ai/latest/en/version3.x/pipeline_usage/pipeline_overview.html(更多能力)
  • 项目官网:https://www.paddleocr.com,仓库地址:https://github.com/PaddlePaddle/PaddleOCR

核心亮点

  • 支持 100+ 语言,覆盖全球主流文字识别场景
  • 提供 PDF 转 Markdown、文档解析等完整工具链,直接对接 RAG
  • 百度持续维护,模型丰富,文档和社区资源完善

不足之处

  • 对复杂版面和手写体的识别精度仍有提升空间
  • 文档/社区待观察

适用场景

  • 将扫描版 PDF 转为可检索的 Markdown 文本,用于知识库构建
  • 从发票、合同等文档中抽取关键字段,实现自动化录入
  • 为多语言 OCR 应用提供轻量级识别服务,如拍照翻译

替代项目

Tesseract OCR、EasyOCR、Surya OCR

项目介绍

PaddleOCR 是计算机视觉领域的开源项目,由 PaddlePaddle 开发,2020 年首次发布。

在全站 12,961 个收录项目中,它的 GitHub 星标数(90,032)位列前 1%,在计算机视觉分类的 446 个项目里位列前 1%。

近 45 天,它的 GitHub 星标从 87,285 增加到 90,032,净增 2,747。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。从国内网络环境看,可直接访问。

它主要面向的使用场景是:将扫描版PDF转为可检索的Markdown文本,用于知识库构建。同类可对比的替代方案包括 Tesseract OCR、EasyOCR、Surya OCR。

上一篇:没有了!

下一篇:Awesome-Try-On-Models

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3995 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2035 2026-08-14