pdf

本站收录 94 个带「pdf」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

markitdownmarkitdown 是微软开源的一个 Python 工具,用于将各种文件和办公文档转换为 Markdown 格式。它支持 PDF、Word、Excel、Pow★ 187,606Stirling PDFStirling PDF 是本地部署的 PDF 工具箱,提供合并、拆分、转换、OCR 等 50 多种操作,文件不出本机。★ 93,264MinerUMinerU 是一个开源工具,能将 PDF、Word 等复杂文档转换为适合大语言模型(LLM)使用的 Markdown 或 JSON 格式。它解决了非结构化文档★ 80,837paperless-ngxpaperless-ngx 是一个社区驱动的增强型文档管理系统,旨在帮助个人和小团队摆脱纸质文件堆积的困扰。它通过扫描、索引和归档所有文档,将纸质文件转化为可搜★ 46,160OCRmyPDFOCRmyPDF 是一个开源命令行工具,专门为扫描版 PDF 文件添加 OCR 文本层,让原本不可搜索的扫描文档变得可搜索、可复制、可索引。它解决的核心问题是:★ 34,903opendataloader-pdfopendataloader-pdf 是一个专为 AI 数据准备而设计的 PDF 解析器,旨在将 PDF 文档自动转换为 AI 可读的结构化数据。它解决了传统 ★ 29,401readestReadest 是一款现代、功能丰富的跨平台电子书阅读器,专为深度阅读爱好者打造。它解决了传统阅读器在平台间切换不便、格式支持不全、阅读体验割裂的问题,提供从 ★ 24,712univerUniver 是一个面向 AI Agent 的办公套件运行时,把电子表格、文档、幻灯片、画布、关系型表格和 PDF 统一到同一套 TypeScript 运行时中★ 20,057ai-pdf-chatbot-langchain基于 LangChain 与 LangGraph 构建的 AI PDF 聊天机器人,支持上传 PDF 文档后进行自然语言问答、内容检索与摘要,是学习 RAG 与★ 16,588unstructuredUnstructured 是一个开源的 ETL 工具,专注于将复杂文档(如 PDF、Word、PPT、图片等)转换为干净、结构化的数据,以便直接用于大语言模型(★ 15,519Skill_SeekersSkill_Seekers 是一个将文档网站、GitHub 仓库和 PDF 自动转换为 Claude AI 技能(Skills)的开源工具。它解决了手动编写 C★ 15,046ImageToolboxImageToolbox 是一款基于 Kotlin 与 Jetpack Compose 开发的开源 Android 图像处理应用,定位为手机上的全能图片工具箱。★ 14,787liteparseliteparse 是一个用 Rust 编写的高性能开源文档解析器,专注于从 PDF、扫描件和图片中快速提取文本与结构化数据。它解决了传统 OCR 工具速度慢、★ 12,719h2ogpth2oGPT 是一个由 H2O.ai 开发的私有化大语言模型聊天助手,旨在让用户完全掌控自己的数据,实现 100% 私密的本地 AI 对话。它解决了企业或个人在★ 11,959PyMuPDFPyMuPDF 是一个高性能的 Python 库,用于 PDF 及其他文档(如 EPUB)的数据提取、分析、转换和操作。它基于 MuPDF 引擎,提供丰富的 A★ 10,808MegaParseMegaParse 是一个专为 LLM 数据摄取而优化的文件解析工具,旨在解决传统解析器在处理 PDF、DOCX、PPTX 等文档时丢失格式和内容的问题。它能够★ 7,414flyingmouse-format飞鼠格式(FlyingMouse Format)是一款面向 Windows 平台的免费离线文件格式转换工具,基于 Electron 构建,内置 FFmpeg、L★ 6,383pdf-craftpdf-craft 是一个专注于将扫描版 PDF 书籍转换为其他格式的开源工具。它利用 deepseek-ocr 等 OCR 技术,解决扫描 PDF 中文字无法★ 6,337naps2NAPS2是一个专为简化扫描流程而设计的开源桌面应用,旨在让用户以最少的操作步骤将纸质文档转换为PDF或其他格式。它解决了传统扫描软件界面复杂、驱动兼容性差、跨★ 4,563KillerPDFKillerPDF 是一款免费开源的 Windows 平台 PDF 编辑器,基于自研的 PDF 2.0 引擎构建,旨在替代 Adobe Acrobat 等商业订★ 4,020text-extract-apitext-extract-api 是一个基于 Python 的文档解析服务,旨在将 PDF、Word、PPTX 等格式的文档以及图片,通过先进的 OCR 技术和★ 3,182takumitakumi 是一个用 Rust 编写的开源工具,用于从 JSX、HTML 和 CSS 渲染 Open Graph 图片和分页 PDF。它解决了传统方案依赖无头★ 3,053SnapOtterSnapOtter 是一个开源、可自托管的文件处理工具,旨在解决个人和企业处理图片、视频、音频、PDF 及文档时依赖云端服务导致的数据隐私和合规问题。它集成了格★ 2,755papersgpt-for-zoteroPapersGPT for Zotero 是一款专为 Zotero 文献管理工具打造的 AI 对话与 MCP 插件,旨在解决科研人员在阅读和管理文献时信息获取效★ 2,662markpdfdownmarkpdfdown 是一款基于大模型视觉识别的高质量 PDF 转 Markdown 工具。它利用多模态大模型(如 GPT-4V 等)对 PDF 页面进行视觉★ 2,293obsidian-omnisearchObsidian Omnisearch 是一款为 Obsidian 笔记软件打造的全文搜索插件,目标是让搜索「开箱即用」。它基于 MiniSearch 实现快速★ 2,156onefilellmonefilellm 是一个将多种来源内容转换为单一文本文件的命令行工具,旨在简化大语言模型(LLM)的数据摄入流程。它支持从 GitHub 仓库、本地目录、G★ 2,021kokoro-ttskokoro-tts 是一个基于 Kokoro 模型的命令行文本转语音工具,主要解决用户快速将文本、电子书(EPUB)和 PDF 文档转换为高质量语音的需求。它★ 1,904dialoqbaseDialoqbase 是一个基于 TypeScript 构建的开源聊天机器人创建平台,旨在让开发者能够轻松构建、部署和管理基于大语言模型的对话应用。它解决了从零★ 1,790extractousextractous 是一个用 Rust 编写的高性能非结构化数据提取库,旨在解决从 PDF、Word、HTML、图片等各类文件中快速提取文本和元数据的问题。它★ 1,780ExtractThinkerExtractThinker 是一个面向大语言模型的文档智能处理库,采用 ORM 风格的设计,让开发者能以类似数据库操作的方式灵活编排文档工作流。它解决了从复杂★ 1,599thepipethepipe 是一个基于视觉语言模型(VLM)的文档数据清洗工具,专门解决从复杂文档(如扫描件、PDF、PPT、表格、手写笔记等)中提取干净结构化数据的问题。★ 1,529MouseTooltipTranslatorMouseTooltipTranslator 是一款功能强大的浏览器扩展,旨在解决多语言阅读和翻译的痛点。它允许用户通过鼠标悬停或划词,在任何网页、PDF、EP★ 1,331ragliteRAGLite 是一个面向检索增强生成(RAG)场景的 Python 工具包,核心特点是基于 DuckDB 或 PostgreSQL 作为向量存储与元数据存储,★ 1,208docx-editordocx-editor(SuperDoc)是一个基于 TypeScript 的开源 DOCX 编辑器与 Agent SDK,目标是让 AI 智能体能够直接读写、★ 1,062pdf_oxidepdf_oxide 是一个用 Rust 编写的高性能 PDF 处理库,提供 Python 和 Rust 双语言接口。它解决了现有 PDF 库处理速度慢、内存占用★ 1,056pdf-reader-mcppdf-reader-mcp 是一个基于 MCP(模型上下文协议)的 PDF 阅读工具,旨在为 AI 智能体提供“眼睛”,使其能够深入理解 PDF 文档。它通过★ 988anymdanymd 是一个用 Rust 编写的本地文档转换工具,目标是把各种格式的文件统一转成干净的 Markdown,方便喂给 AI 智能体或大模型。它支持 PDF、★ 988chatWebchatWeb 是一个基于 Python 的开源对话助手,能够抓取网页、读取 PDF、DOCX、TXT 等文档,提取主要内容后,结合 OpenAI GPT 模型★ 917spacy-layoutspacy-layout 是一个将文档布局分析能力集成到 spaCy 生态的 Python 库,旨在让开发者用统一接口处理 PDF、Word 等复杂文档,并将版★ 912llm.pdfllm.pdf 是一个把大语言模型直接塞进 PDF 文件里运行的开源实验项目。它利用 PDF 支持嵌入 JavaScript 的特性,把模型推理逻辑和轻量级权重★ 870ChatPDFChatPDF 是一个面向本地大语言模型的 RAG(检索增强生成)工具,专注于让用户直接与 PDF、Word、TXT 等文档进行对话。它解决了本地模型缺乏外部知★ 859luelue 是一个运行在终端里的电子书阅读器,核心亮点是集成了高品质的文本转语音(TTS)功能,让用户能在命令行环境中获得类似有声书的阅读体验。它支持 EPUB、P★ 816IncarnaMindIncarnaMind 是一个开源的本地文档对话助手,旨在让用户通过自然语言与多个 PDF 和 TXT 文档进行交互。它解决了传统文档检索繁琐、信息定位困难的问★ 802presenta-libpresenta-lib 是一个面向自动化时代的 JavaScript 演示文稿生成库。它解决的是在自动化流程中动态创建和定制演示文稿(如幻灯片、横幅、目录、画★ 707obsidian-llm-wikiobsidian-llm-wiki 是一个 Obsidian 插件,把 Karpathy 提出的 LLM Wiki 思路落地到本地笔记库。它自动扫描你的 Mar★ 668obsidian-text-extractorobsidian-text-extractor 是一个 Obsidian 笔记软件的配套插件,用于从图片和 PDF 文件中提取文字。它解决的核心问题是:用户在 ★ 642docsagentDocsAgent 是一个本地优先的个人知识库检索工具,通过 MCP 协议为 Claude、Cursor、Cline 等 AI 客户端提供即时、私密的资料访问能★ 623OfficeIMOOfficeIMO 是一套基于 .NET 的开源库,采用 MIT 许可证,专注于 Office 文档的全面处理。它无需依赖 COM 组件,即可创建、读取、编辑、★ 564wdocwdoc 是一个面向异构文档的智能知识管理与检索工具,旨在解决从大量格式各异的文档中快速提取和查询信息的痛点。它支持接入任意 LLM 提供商(如 OpenAI、★ 545