
ExtractPDF4J
Java 库从文本/扫描 PDF 里抽结构化表格
ExtractPDF4J 是一个用 Java 编写的 PDF 表格提取与 OCR 库,主要解决从 PDF 中稳定抽取结构化表格数据的问题。它同时支持文本型 PDF 和扫描件:对文本型 PDF 提供流式解析(stream)和基于 OpenCV 风格网格检测的 lattice 解析,对扫描件则结合 OCR 识别文字,并可用 hybrid 模式混合两种策略以提升复杂版式的准确率。项目面向 Java 17 与 Maven 生态,提供 CLI 与库两种使用方式,输出结构化表格数据,方便后续入库、分析或转换。相比只做文本抽取的工具,它把表格线检测、单元格切分与 OCR 串联成一条流水线,适合需要在 JVM 服务端批量处理发票、报表、对账单等文档的场景。
开源
free
计算机视觉
GitHub 星标
★ 518
维护状态
活跃
是否开源
是
定价模式
free
项目数据
分类计算机视觉
开发团队ExtractPDF4J
所属国家
定价模式free
价格说明开源免费,采用开源许可证
访问状态
是否开源是
开源协议NOASSERTION
主要语言Java
技术栈/模型cli,document-processing,java,java17,maven,ocr,ocr-recognition,pdf-document,pdf-document-processor,pdf-extraction,pdf-extractor,pdf-processor
GitHub 星标★ 518
30天Star增速
HF 下载量
上线时间2025-08-14 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0
使用教程
核心亮点
- 同时覆盖文本型与扫描型 PDF,stream、lattice、hybrid 三种解析模式可按版式切换
- lattice 用 OpenCV 风格网格检测处理有线表格,对规整报表识别更稳
- Java 17 + Maven,提供 CLI 和库两种接入方式,方便嵌入 JVM 后端服务
不足之处
- 早期项目,复杂合并单元格与无框线表格的准确率仍需实测验证
- 文档与社区规模较小,遇到边界版式问题可参考的案例有限
适用场景
- 批量解析发票、对账单,把表格数据写入数据库
- 在 Java 后端服务中抽取报表 PDF 并转成 CSV/JSON
- 对扫描版合同或清单做 OCR 后提取结构化字段
替代项目
Tabula、Camelot、PDFPlumber
项目介绍
上一篇:yomihon
下一篇:RawMangaReader
同类项目推荐
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3