pdf-parser

本站收录 15 个带「pdf-parser」标签的 AI 开源项目

PaddleOCRPaddleOCR 是百度开源的 OCR 工具库,旨在将任意 PDF 或图片文档转化为结构化数据,供 AI 系统使用。它解决了图像和 PDF 中文字信息难以被机★ 90,415MinerUMinerU 是一个开源工具,能将 PDF、Word 等复杂文档转换为适合大语言模型(LLM)使用的 Markdown 或 JSON 格式。它解决了非结构化文档★ 80,837opendataloader-pdfopendataloader-pdf 是一个专为 AI 数据准备而设计的 PDF 解析器,旨在将 PDF 文档自动转换为 AI 可读的结构化数据。它解决了传统 ★ 29,401liteparseliteparse 是一个用 Rust 编写的高性能开源文档解析器,专注于从 PDF、扫描件和图片中快速提取文本与结构化数据。它解决了传统 OCR 工具速度慢、★ 12,719pdf-craftpdf-craft 是一个专注于将扫描版 PDF 书籍转换为其他格式的开源工具。它利用 deepseek-ocr 等 OCR 技术,解决扫描 PDF 中文字无法★ 6,337extractousextractous 是一个用 Rust 编写的高性能非结构化数据提取库,旨在解决从 PDF、Word、HTML、图片等各类文件中快速提取文本和元数据的问题。它★ 1,780docstrangedocstrange 是一个基于 Python 的文档数据提取与转换工具,旨在解决从多种文档格式(如 PDF、Word、PPT、图片及 URL)中高效提取结构化★ 1,574pdf_oxidepdf_oxide 是一个用 Rust 编写的高性能 PDF 处理库,提供 Python 和 Rust 双语言接口。它解决了现有 PDF 库处理速度慢、内存占用★ 1,056smart-llm-loadersmart-llm-loader 是一个轻量级 Python 包,用于将各种文档(PDF、Markdown 等)转换为适合 LLM 处理的文本块。它解决了 RA★ 291llmdocparserllmdocparser 是一个基于 Python 的 PDF 解析与内容分析工具,它利用大型语言模型(LLM)来理解和提取 PDF 文档中的结构化信息。该项目★ 267oxidizePdfoxidizePdf 是一个用纯 Rust 编写的 PDF 处理库,专为 AI 和 RAG 场景设计。它解决了 PDF 在检索增强生成中文本提取结构混乱、分块不★ 192MinerU-SkillMinerU-Skill 是一个面向 AI 原生工作流的文档解析工具,能把 PDF、Office 文档和图片统一转换成干净的 Markdown。它重点解决大模型★ 119arxiearxie 是一个面向学术研究场景的 AI 智能体,它通过深度分析 arXiv 论文,为研究者提供基于文献的反馈和假设生成。该工具解决的核心问题是:在海量论文中★ 114LexoidLexoid 是一个开源的通用适配器,旨在将杂乱无章的真实世界数据转化为干净、可供 AI 智能体直接使用的上下文。它解决了 LLM 应用中数据质量差、格式不统一★ 107DocMeldDocMeld 是一个轻量级的文档到智能体就绪知识流水线工具,专为处理研究论文和书籍设计。它采用三阶段的 Bronze→Silver→Gold 架构,依次提取结★ 102