
paddleocr-local
本地把 PDF/Office 转 Markdown,五种 OCR 模型随你换
paddleocr-local 是一个本地优先的文档解析工作台,把 PDF、Office 等格式的文件转换成 Markdown,全程在本机完成,不上传云端。它集成了五种 OCR 模型(含 PaddleOCR、PaddleOCR-VL 等),用户可以在 WebUI 里自由切换模型、对比识别效果,也提供命令行接口方便批量处理。项目用 FastAPI 搭建服务,支持 Docker 部署,并针对 Apple Silicon 做了 MLX 加速适配,适合对数据隐私敏感、又需要高质量文档数字化的场景。核心价值在于把模型选择、格式转换、可视化操作打包成一个开箱即用的自托管工具,省去自己拼装 OCR 流水线的麻烦,同时避免调用商业 API 带来的成本和数据外泄风险。
开源
free
计算机视觉
GitHub 星标
★ 130
维护状态
较活跃
是否开源
是
定价模式
free
项目数据
分类计算机视觉
开发团队CHEN010325
所属国家
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型docker,document-ai,document-ocr,fastapi,local-ai,mlx,ocr,paddleocr,paddleocr-vl,pdf-to-markdown,self-hosted,webui
GitHub 星标★ 130
30天Star增速
HF 下载量
上线时间2026-02-23 00:00:00
最近更新2026-09-16 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0
使用教程
核心亮点
- 内置五种 OCR 模型可在 WebUI 中一键切换对比,不用自己搭多套环境
- 支持 Apple Silicon 的 MLX 加速,Mac 用户本地跑 OCR 速度有保障
- 提供 WebUI + CLI 双入口,既能可视化操作也能脚本批量处理
不足之处
- 项目仅 130 星,属于早期阶段,模型适配和边界情况处理可能不够稳定
- 五种模型的显存/内存占用和速度差异缺少明确文档说明,选型需自行试错
适用场景
- 把扫描版 PDF 合同、发票批量转成可编辑 Markdown 存档
- 在 Mac 上本地处理敏感文档,避免上传到第三方 OCR 服务
- 对比不同 OCR 模型对同一份复杂版式文档的识别效果
替代项目
PaddleOCR、MinerU、marker
项目介绍
上一篇:RawMangaReader
下一篇:jietuba
同类项目推荐
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3