pdf-converter

本站收录 12 个带「pdf-converter」标签的 AI 开源项目

Stirling PDFStirling PDF 是本地部署的 PDF 工具箱,提供合并、拆分、转换、OCR 等 50 多种操作,文件不出本机。★ 93,264MinerUMinerU 是一个开源工具,能将 PDF、Word 等复杂文档转换为适合大语言模型(LLM)使用的 Markdown 或 JSON 格式。它解决了非结构化文档★ 80,837opendataloader-pdfopendataloader-pdf 是一个专为 AI 数据准备而设计的 PDF 解析器,旨在将 PDF 文档自动转换为 AI 可读的结构化数据。它解决了传统 ★ 29,401pdf-craftpdf-craft 是一个专注于将扫描版 PDF 书籍转换为其他格式的开源工具。它利用 deepseek-ocr 等 OCR 技术,解决扫描 PDF 中文字无法★ 6,337markpdfdownmarkpdfdown 是一款基于大模型视觉识别的高质量 PDF 转 Markdown 工具。它利用多模态大模型(如 GPT-4V 等)对 PDF 页面进行视觉★ 2,293spacy-layoutspacy-layout 是一个将文档布局分析能力集成到 spaCy 生态的 Python 库,旨在让开发者用统一接口处理 PDF、Word 等复杂文档,并将版★ 912smart-llm-loadersmart-llm-loader 是一个轻量级 Python 包,用于将各种文档(PDF、Markdown 等)转换为适合 LLM 处理的文本块。它解决了 RA★ 291deepsearch-toolkitdeepsearch-toolkit 是一个用于与 IBM Deep Search 平台交互的 Python 工具包,旨在帮助研究人员和开发者通过 API 访问★ 228pdf-to-markdownpdf-to-markdown 是一个将 PDF 文件转换为干净、结构化 Markdown 的 Python 工具。它解决了从 PDF 中提取文本时格式混乱、难★ 207DocMeldDocMeld 是一个轻量级的文档到智能体就绪知识流水线工具,专为处理研究论文和书籍设计。它采用三阶段的 Bronze→Silver→Gold 架构,依次提取结★ 102ChurroChurro 是一个面向历史文献转录的 OCR 工具包,旨在以高精度和低成本让手写及印刷的历史资料变得可读。它基于 Python 构建,专门处理古籍、档案等复杂★ 79papercastpapercast 是一个基于 Python 的管道工具和插件生态系统,用于将技术文档(如 arXiv 论文、SemanticScholar 条目或本地 PDF★ 52