local-llm-pdf-ocr

本地跑视觉大模型,扫描 PDF 秒变可搜索文本

local-llm-pdf-ocr 是一个把扫描版 PDF 转成可搜索文本的本地工具,核心思路是调用视觉大模型 olmOCR 完成 OCR,全程离线运行,不上传任何文件,也不需要 API Key。它解决的是传统 OCR 对复杂排版、表格、公式识别差,以及云端 OCR 服务收费、隐私风险高的问题。项目同时提供现代 Web UI 和 CLI 两种使用方式,后端基于 FastAPI,支持把识别结果写回 PDF 生成可搜索文档。适合处理合同、论文、发票、书籍等扫描件,尤其适合对数据隐私敏感、不想把文件交给第三方云服务的个人和小团队。安装后只需本地跑起服务,上传 PDF 即可得到带文字层的可搜索版本,免费且可批量处理。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 120
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类计算机视觉
开发团队ahnafnafee
所属国家
定价模式free
价格说明开源免费,本地离线运行无需API密钥
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型document-processing,fastapi,local-llm,no-api-key,ocr,offline-ai,olmocr,pdf-ocr,privacy-focused,python,searchable-pdf,surya-ocr,vision-llm,web-ui
GitHub 星标★ 120
30天Star增速
HF 下载量
上线时间2025-12-14 00:00:00
最近更新2026-09-28 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-29
浏览次数0

使用教程

核心亮点

  • 完全离线运行,文件不出本机,无 API Key 和调用费用
  • 用 olmOCR 视觉大模型做 OCR,对复杂版式、表格、公式的识别优于传统 OCR
  • 同时提供 Web UI 和 CLI,既能交互式上传也能脚本批量处理

不足之处

  • 依赖本地视觉大模型,对显卡显存和算力有要求,低配机器体验受限
  • 项目星标约 120,属于早期阶段,文档和社区生态还在完善中

适用场景

  • 处理含表格、公式的学术论文扫描件,转成可搜索 PDF 便于检索引用
  • 律师或财务人员本地批量 OCR 合同、发票,避免敏感文件上传云端
  • 个人把纸质书扫描件转成可搜索文本,离线整理个人知识库

替代项目

OCRmyPDF、PaddleOCR、Tesseract

项目介绍

local-llm-pdf-ocr 是计算机视觉领域的开源项目,由 ahnafnafee 开发,2025 年首次发布。

它收录于计算机视觉分类,该分类目前共有 467 个项目,GitHub 星标数为 120。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-28。开源免费,本地离线运行无需API密钥。

它主要面向的使用场景是:处理含表格、公式的学术论文扫描件,转成可搜索PDF便于检索引用。同类可对比的替代方案包括 OCRmyPDF、PaddleOCR、Tesseract。

上一篇:laravel-ocr

下一篇:manuscript-ocr

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4045 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90972 2026-08-10
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1431 2026-08-20