pdf-to-markdown
本站收录 15 个带「pdf-to-markdown」标签的 AI 开源项目
book-to-skillbook-to-skill 是一个将技术书籍 PDF 转化为 Claude Code 技能(Skill)的开源工具。它解决了开发者阅读技术书籍时难以将知识直接应★ 33,016
pdf-craftpdf-craft 是一个专注于将扫描版 PDF 书籍转换为其他格式的开源工具。它利用 deepseek-ocr 等 OCR 技术,解决扫描 PDF 中文字无法★ 6,337
docstrangedocstrange 是一个基于 Python 的文档数据提取与转换工具,旨在解决从多种文档格式(如 PDF、Word、PPT、图片及 URL)中高效提取结构化★ 1,574
pdf_oxidepdf_oxide 是一个用 Rust 编写的高性能 PDF 处理库,提供 Python 和 Rust 双语言接口。它解决了现有 PDF 库处理速度慢、内存占用★ 1,056
pdf-reader-mcppdf-reader-mcp 是一个基于 MCP(模型上下文协议)的 PDF 阅读工具,旨在为 AI 智能体提供“眼睛”,使其能够深入理解 PDF 文档。它通过★ 988
anymdanymd 是一个用 Rust 编写的本地文档转换工具,目标是把各种格式的文件统一转成干净的 Markdown,方便喂给 AI 智能体或大模型。它支持 PDF、★ 988
mdfluxmdflux 是一款本地优先的桌面应用,能将扫描版 PDF、图片等文档批量转换为干净、AI 就绪的 Markdown 格式。它解决的是传统 OCR 工具输出杂乱★ 536
smart-llm-loadersmart-llm-loader 是一个轻量级 Python 包,用于将各种文档(PDF、Markdown 等)转换为适合 LLM 处理的文本块。它解决了 RA★ 291
pdf-to-markdownpdf-to-markdown 是一个将 PDF 文件转换为干净、结构化 Markdown 的 Python 工具。它解决了从 PDF 中提取文本时格式混乱、难★ 207
chunkychunky 是一个面向可靠 RAG(检索增强生成)管道的开源工具包,主要解决文档处理与分块环节中的痛点。它提供从 PDF 到 Markdown 的转换、文档清★ 182
paddleocr-localpaddleocr-local 是一个本地优先的文档解析工作台,把 PDF、Office 等格式的文件转换成 Markdown,全程在本机完成,不上传云端。它集★ 132
MinerU-SkillMinerU-Skill 是一个面向 AI 原生工作流的文档解析工具,能把 PDF、Office 文档和图片统一转换成干净的 Markdown。它重点解决大模型★ 119
LT2MDLT2MD 是一个面向 AI Agent 的 PDF 转 Markdown 技能,专门解决传统转换工具把流程图、示意图和图表变成空链接或丢失内容的问题。它会把这★ 109
textbook-to-notetextbook-to-note 是一个把个人 PDF 教材转成可 AI 检索知识库和结构化笔记的开源工具。它针对学生和自学者在复习时难以快速定位教材内容、手动★ 104
ChurroChurro 是一个面向历史文献转录的 OCR 工具包,旨在以高精度和低成本让手写及印刷的历史资料变得可读。它基于 Python 构建,专门处理古籍、档案等复杂★ 79