pdf-mcp

让 AI 轻松啃下大型 PDF,不爆上下文

pdf-mcp 是一个基于 MCP 协议的服务器,旨在让 Claude Code 等 AI 代理高效处理大型 PDF 文件及整个文件夹,避免上下文溢出。它通过混合语义搜索与关键词搜索,实现选择性页面读取,支持表格、图片、OCR、图表数据提取,并兼容多栏和 CJK 布局。该工具解决了 AI 直接读取大型 PDF 时上下文窗口不足、信息提取困难的问题,核心能力包括智能分块、混合检索、按需加载页面内容,以及结构化数据抽取。适用于法律、金融、学术等需要处理大量 PDF 文档的场景,帮助 AI 代理在有限上下文内快速定位并利用关键信息。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 137
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队jztan
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型agentic-rag,ai,cjk,claude,claude-code,codex-cli,document-processing,llm,mcp,mcp-server,model-context-protocol,ocr,opencode,pdf,pdf-extraction,pymupdf,python,rag,semantic-search,table-extraction
GitHub 星标★ 137
30天Star增速
HF 下载量
上线时间2026-01-28 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 混合语义+关键词搜索,精准定位内容
  • 支持表格、图片、OCR和图表数据提取
  • 针对多栏和CJK排版优化,中文友好

不足之处

  • 项目较新,文档和社区生态待观察
  • 依赖MCP协议,需配合支持MCP的AI工具使用

适用场景

  • 法律合同审阅,快速提取关键条款
  • 学术论文批量分析,抽取图表数据
  • 金融报告处理,定位财务数据

替代项目

markitdown、pypdf、unstructured

项目介绍

pdf-mcp 是智能体领域的开源项目,由 jztan 开发,是 2026 年新上线的项目。

它收录于智能体分类,该分类目前共有 2,499 个项目,GitHub 星标数为 137。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:法律合同审阅,快速提取关键条款。同类可对比的替代方案包括 markitdown、pypdf、unstructured。

上一篇:GPT-Gradio-Agent

下一篇:CodeWhale

同类项目推荐

xinchao-dynamic-mind 开源

给 AI 装上疲惫和欲望,让交互更真实

独立、可自托管的 AI 动态心智状态引擎:驱动力、念头池、疲惫、睡眠与意图。

★ 195 2026-08-09
deepseek-harness 开源

把 AI 能力拆成乐高积木,拼出你的专属智能体。

DeepSeek Harness: Everything is a Plugin.

★ 233327 2026-08-15
AutoGPT 开源

开箱即用的 AI 员工,交代任务就自己干完

AutoGPT is the vision of accessible AI for everyone, to use and to build on. Our mis···

★ 187492 2026-08-09
EvoAgentX 开源

让 AI 智能体自己迭代变强,越用越聪明

EvoAgentX: Building a Self-Evolving Ecosystem of AI Agents

★ 3351 2026-09-12