pdfstract

把 PDF 变成可检索的向量,RAG 预处理一步到位。

PDFStract 是一个专注于 RAG(检索增强生成)流程的 PDF 处理工具,提供从 PDF 中提取文本、智能分块(chunking)和向量化嵌入(embedding)的一体化解决方案。它解决了 RAG 应用中 PDF 文档解析质量差、分块策略不合理导致检索效果不佳的问题。核心能力包括:支持多种 PDF 解析方式,能处理复杂布局;内置多种分块策略,可自定义块大小和重叠;集成了主流嵌入模型接口,方便生成向量;提供命令行(CLI)、Web 界面(WEBUI)和 API 三种使用方式,便于集成到现有系统。项目处于早期阶段,但定位清晰,旨在成为 RAG 管道中 PDF 预处理的标准层。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 153
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队AKSarav
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型ai,chunking,data-extraction,dataengineering,docling,knowledgebase,ocr,pdf,pdfconversion,rag,rag-pipeline,unstructured
GitHub 星标★ 153
30天Star增速
HF 下载量
上线时间2025-07-14 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数0

使用教程

核心亮点

  • 提供 CLI、WebUI、API 三种使用方式,灵活适配不同场景。
  • 内置多种分块策略,可调节块大小与重叠,优化检索效果。
  • 集成主流嵌入模型,简化向量化流程,降低上手门槛。

不足之处

  • 项目处于早期阶段(152 星),功能稳定性和生态成熟度待验证。
  • 文档和社区支持相对薄弱,遇到问题可参考资源有限。

适用场景

  • 构建企业知识库问答系统,需要高效处理大量 PDF 文档。
  • 开发 RAG 应用时,需要快速将 PDF 内容转换为可检索的向量。
  • 对 PDF 解析和分块效果有较高要求,希望精细化控制预处理流程。

替代项目

LlamaIndex、LangChain、unstructured

项目介绍

pdfstract 是搜索知识领域的开源项目,由 AKSarav 开发,2025 年首次发布。

它收录于搜索知识分类,该分类目前共有 585 个项目,GitHub 星标数为 153。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用,无付费版本。

它主要面向的使用场景是:构建企业知识库问答系统,需要高效处理大量PDF文档。同类可对比的替代方案包括 LlamaIndex、LangChain、unstructured。

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
ragflow 开源

让大模型用上你的私有知识,搭建可靠的企业级RAG应用

RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···

★ 91170 2026-08-09