ExtractPDF4J

Java 库从文本/扫描 PDF 里抽结构化表格

ExtractPDF4J 是一个用 Java 编写的 PDF 表格提取与 OCR 库,主要解决从 PDF 中稳定抽取结构化表格数据的问题。它同时支持文本型 PDF 和扫描件:对文本型 PDF 提供流式解析(stream)和基于 OpenCV 风格网格检测的 lattice 解析,对扫描件则结合 OCR 识别文字,并可用 hybrid 模式混合两种策略以提升复杂版式的准确率。项目面向 Java 17 与 Maven 生态,提供 CLI 与库两种使用方式,输出结构化表格数据,方便后续入库、分析或转换。相比只做文本抽取的工具,它把表格线检测、单元格切分与 OCR 串联成一条流水线,适合需要在 JVM 服务端批量处理发票、报表、对账单等文档的场景。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 518
维护状态 活跃
是否开源
定价模式 free

项目数据

分类计算机视觉
开发团队ExtractPDF4J
所属国家
定价模式free
价格说明开源免费,采用开源许可证
访问状态
是否开源
开源协议NOASSERTION
主要语言Java
技术栈/模型cli,document-processing,java,java17,maven,ocr,ocr-recognition,pdf-document,pdf-document-processor,pdf-extraction,pdf-extractor,pdf-processor
GitHub 星标★ 518
30天Star增速
HF 下载量
上线时间2025-08-14 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0

使用教程

核心亮点

  • 同时覆盖文本型与扫描型 PDF,stream、lattice、hybrid 三种解析模式可按版式切换
  • lattice 用 OpenCV 风格网格检测处理有线表格,对规整报表识别更稳
  • Java 17 + Maven,提供 CLI 和库两种接入方式,方便嵌入 JVM 后端服务

不足之处

  • 早期项目,复杂合并单元格与无框线表格的准确率仍需实测验证
  • 文档与社区规模较小,遇到边界版式问题可参考的案例有限

适用场景

  • 批量解析发票、对账单,把表格数据写入数据库
  • 在 Java 后端服务中抽取报表 PDF 并转成 CSV/JSON
  • 对扫描版合同或清单做 OCR 后提取结构化字段

替代项目

Tabula、Camelot、PDFPlumber

项目介绍

ExtractPDF4J 是一个计算机视觉领域的开源项目,官方简介:Java PDF table extraction & OCR library. Extract structured tables from text-based and scanned PDFs using stream, lattice (OpenCV-style grid detection), and hybrid parsing.。项目使用 Java 开发,在 GitHub 上获得 518 星标。

上一篇:yomihon

下一篇:RawMangaReader

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3973 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90860 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2032 2026-08-14