pdf-to-markdown

把 PDF 变成干净 Markdown,文档处理省心省力

pdf-to-markdown 是一个将 PDF 文件转换为干净、结构化 Markdown 的 Python 工具。它解决了从 PDF 中提取文本时格式混乱、难以复用的问题,能够自动识别文档结构,将标题、段落、列表等元素转换为对应的 Markdown 语法,输出易于编辑和阅读的纯文本格式。核心能力包括:高效的 PDF 解析、智能的版面分析、以及 Markdown 格式的规范化输出。适合需要批量处理 PDF 文档、构建知识库或进行文本挖掘的用户。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 207
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队iamarunbrahma
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型document-conversion,document-processing,information-retrieval,pdf-converter,pdf-extraction,pdf-parsing,pdf-to-markdown,python,rag,retrieval-augmented-generation,text-extraction
GitHub 星标★ 207
30天Star增速
HF 下载量
上线时间2024-09-10 00:00:00
最近更新2026-09-20 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

核心亮点

  • 输出结构清晰,标题、列表等元素自动转换,保留文档层次
  • 基于 Python,易于集成到自动化工作流或脚本中
  • 专注单一任务,转换质量稳定,适合批量处理

不足之处

  • 项目早期,星标少,功能可能不完善
  • 文档/社区待观察

适用场景

  • 将学术论文或报告转换为 Markdown 便于笔记整理
  • 批量转换 PDF 文档以构建本地知识库
  • 在数据管道中提取 PDF 文本用于后续 NLP 处理

替代项目

marker、pandoc、pdfplumber

项目介绍

pdf-to-markdown 是办公效率领域的开源项目,由 iamarunbrahma 开发,2024 年首次发布。

它收录于办公效率分类,该分类目前共有 142 个项目,GitHub 星标数为 207。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-20。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:将学术论文或报告转换为Markdown便于笔记整理。同类可对比的替代方案包括 marker、pandoc、pdfplumber。

上一篇:pdf2md

下一篇:humla

同类项目推荐

sunshine-control-panel 开源

一站式管理游戏库、监控内存,AI 助手加持,让大屏启动更高效。

Sunshine Foundation 大屏桌面管理器 | Tauri + Vue 3,游戏库管理、米塔AI助手、内存监控···

★ 444 2026-08-09
Stirling PDF 开源

本地部署 PDF 工具箱

#1 PDF Application on GitHub that lets you edit PDFs on any device anywhere

★ 92816 2026-08-19
obsidian-md2wechat 开源

一键将 Obsidian 笔记排版成公众号文章,告别手动调格式

Obsidian → WeChat | Obsidian 插件一键排版发布到微信公众号,键排版发布到微信公众号:···

★ 318 2026-08-09
pdf2md 开源

浏览器里直接把 PDF 变成 Markdown,不用上传,隐私安全。

Browser based tool to convert PDFs to Markdown

★ 381 2026-08-09