parsemypdf

一个接口切换多种 PDF 解析器,快速提取文本表格

parsemypdf 是一个 Python 编写的 PDF 解析工具集合,把多种主流解析方案整合到统一接口下,包括基于 AI 的 docling、Claude、OpenAI、Gemini、Meta llama-vision,以及传统库 pdfminer、pymupdf、pdfplumber、unstructured-io 等。它解决的核心问题是:PDF 格式复杂多样,不同解析器在文本、表格、元数据、扫描件上的表现差异很大,开发者往往需要逐个试错、写大量适配代码。该项目提供一致的调用方式,让用户快速切换解析后端,完成快照、文本、表格和元数据提取,并对比不同方案的效果。适合需要批量处理 PDF、构建 RAG 数据管道或做文档智能分析的开发者,降低选型和集成成本。

开源 unknown 办公效率
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 197
维护状态 较活跃
是否开源 是
定价模式 unknown

项目数据

分类办公效率
开发团队genieincodebottle
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型camelot,claude,docling,gemini-ai,gemini-pro,llama-parse,llama-vision,llama4,markitdown,mistral-ocr,ocr,ocr-python,omniai,openai,pymupdf,pypdf,smoldocling,unstructured-io
GitHub 星标★ 197
30天Star增速
HF 下载量
上线时间2024-11-28 00:00:00
最近更新2026-09-15 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-30
浏览次数0

使用教程

核心亮点

  • 统一封装 AI 与传统共十余种解析后端,切换成本低
  • 覆盖文本、表格、元数据、快照多类提取需求
  • 集成 docling、llama-vision、mistral-ocr 等较新方案,紧跟生态

不足之处

  • 项目处于早期,星标少,API 与文档可能不稳定
  • 多后端依赖较重,安装和密钥配置门槛较高

适用场景

  • 批量 PDF 转结构化文本用于 RAG 知识库
  • 对比不同解析器在复杂表格上的效果
  • 扫描件与文档元数据的自动化提取

替代项目

unstructured、docling、markitdown

项目介绍

parsemypdf 是办公效率领域的开源项目,由 genieincodebottle 开发,2024 年首次发布。

它收录于办公效率分类,该分类目前共有 157 个项目,GitHub 星标数为 197。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-15。

它主要面向的使用场景是:批量PDF转结构化文本用于RAG知识库。同类可对比的替代方案包括 unstructured、docling、markitdown。

上一篇:jt-doc-tools

下一篇:formkiq-core

同类项目推荐

sunshine-control-panel 开源

一站式管理游戏库、监控内存,AI 助手加持,让大屏启动更高效。

Sunshine Foundation 大屏桌面管理器 | Tauri + Vue 3,游戏库管理、米塔AI助手、内存监控···

★ 444 2026-08-09
Stirling PDF 开源

本地部署 PDF 工具箱

#1 PDF Application on GitHub that lets you edit PDFs on any device anywhere

★ 93264 2026-08-19
obsidian-md2wechat 开源

一键将 Obsidian 笔记排版成公众号文章,告别手动调格式

Obsidian → WeChat | Obsidian 插件一键排版发布到微信公众号,键排版发布到微信公众号:···

★ 318 2026-08-09
pdf2md 开源

浏览器里直接把 PDF 变成 Markdown,不用上传,隐私安全。

Browser based tool to convert PDFs to Markdown

★ 381 2026-08-09