pdfparser

纯 PHP 从 PDF 里抽文本、Markdown 和图片,快且省内存

pdfparser 是一个用 PHP 从零实现的 PDF 解析库,目标是在不依赖外部二进制工具的前提下,读取 PDF 并抽取文本、Markdown 与图片。它解决的是 PHP 生态里 PDF 内容提取方案偏少、常见做法要调用 pdftotext 等命令行工具或依赖扩展的问题,让纯 PHP 项目也能直接处理 PDF。核心能力包括:解析 PDF 对象结构与内容流,输出纯文本或 Markdown 格式,提取内嵌图片,并强调速度快、内存占用低,适合在 Web 请求或队列任务中处理中等规模文档。项目以库的形式提供,可被 Laravel、Symfony 等框架集成,用于构建文档检索、内容入库、发票或报表信息抽取等流程。目前星标约 176,属于早期项目,API 与边界情况仍在演进,建议先在测试集上验证目标 PDF 的解析效果再上生产。

开源 free 办公效率
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 176
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类办公效率
开发团队PrinsFrank
所属国家
官网地址
定价模式free
价格说明开源免费使用
访问状态
是否开源是
开源协议MIT
主要语言PHP
技术栈/模型document-parser,parser,pdf,pdf-library,pdf-parser,pdf-reader,pdfparser,php,text-extraction
GitHub 星标★ 176
30天Star增速
HF 下载量
上线时间2022-05-06 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-07
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • 纯 PHP 实现,不依赖 pdftotext、ImageMagick 等外部二进制,部署环境更简单
  • 同时支持文本、Markdown 和图片三种输出,便于直接接入检索或内容展示
  • 官方强调低内存与速度,适合在 Web 请求或队列任务中处理文档

不足之处

  • 项目处于早期,复杂版式、扫描件、加密 PDF 等边界情况覆盖有限
  • 社区与文档规模较小,遇到问题可参考的案例和第三方资料不多

适用场景

  • 把用户上传的 PDF 简历、合同批量抽取文本入库做全文检索
  • 将 PDF 报告转成 Markdown 供知识库或 AI 问答使用
  • 从 PDF 中提取图片,用于素材归档或内容再加工

替代项目

smalot/pdfparser、spatie/pdf-to-text

项目介绍

pdfparser 是办公效率领域的开源项目,由 PrinsFrank 开发,2022 年首次发布。

它收录于办公效率分类,该分类目前共有 169 个项目,GitHub 星标数为 176。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-06。开源免费使用。

它主要面向的使用场景是:把用户上传的PDF简历、合同批量抽取文本入库做全文检索。同类可对比的替代方案包括 smalot/pdfparser、spatie/pdf-to-text。

上一篇:awesome-ai-ppt

下一篇:没有了!

同类项目推荐

sunshine-control-panel 开源

一站式管理游戏库、监控内存,AI 助手加持,让大屏启动更高效。

Sunshine Foundation 大屏桌面管理器 | Tauri + Vue 3,游戏库管理、米塔AI助手、内存监控···

★ 446 2026-08-09
Stirling PDF 开源

本地部署 PDF 工具箱

#1 PDF Application on GitHub that lets you edit PDFs on any device anywhere

★ 93676 2026-08-19
obsidian-md2wechat 开源

一键将 Obsidian 笔记排版成公众号文章,告别手动调格式

Obsidian → WeChat | Obsidian 插件一键排版发布到微信公众号,键排版发布到微信公众号:···

★ 316 2026-08-09
pdf2md 开源

浏览器里直接把 PDF 变成 Markdown,不用上传,隐私安全。

Browser based tool to convert PDFs to Markdown

★ 381 2026-08-09