pdfstract 是搜索知识领域的开源项目,由 AKSarav 开发,2025 年首次发布。
它收录于搜索知识分类,该分类目前共有 585 个项目,GitHub 星标数为 153。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用,无付费版本。
它主要面向的使用场景是:构建企业知识库问答系统,需要高效处理大量PDF文档。同类可对比的替代方案包括 LlamaIndex、LangChain、unstructured。

把 PDF 变成可检索的向量,RAG 预处理一步到位。
PDFStract 是一个专注于 RAG(检索增强生成)流程的 PDF 处理工具,提供从 PDF 中提取文本、智能分块(chunking)和向量化嵌入(embedding)的一体化解决方案。它解决了 RAG 应用中 PDF 文档解析质量差、分块策略不合理导致检索效果不佳的问题。核心能力包括:支持多种 PDF 解析方式,能处理复杂布局;内置多种分块策略,可自定义块大小和重叠;集成了主流嵌入模型接口,方便生成向量;提供命令行(CLI)、Web 界面(WEBUI)和 API 三种使用方式,便于集成到现有系统。项目处于早期阶段,但定位清晰,旨在成为 RAG 管道中 PDF 预处理的标准层。
LlamaIndex、LangChain、unstructured
pdfstract 是搜索知识领域的开源项目,由 AKSarav 开发,2025 年首次发布。
它收录于搜索知识分类,该分类目前共有 585 个项目,GitHub 星标数为 153。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用,无付费版本。
它主要面向的使用场景是:构建企业知识库问答系统,需要高效处理大量PDF文档。同类可对比的替代方案包括 LlamaIndex、LangChain、unstructured。
firecrawl
开源
网页抓取像喝水一样简单,开发者省下整周加班
The web data API to search, scrape, and interact at scale.
contoso-chat
开源
一键跑通 Azure RAG 应用,从代码到评估部署全流程
This sample has the full End2End process of creating RAG application with Prompty an···
graphify
开源
整个代码库画成一张图,找问题一眼定位
Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···
ragflow
开源
让大模型用上你的私有知识,搭建可靠的企业级RAG应用
RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···