llm-reader 是搜索知识领域的开源项目,由 m92vyas 开发,2024 年首次发布。
它收录于搜索知识分类,该分类目前共有 585 个项目,GitHub 星标数为 311。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-24。MIT许可证,完全免费,需自行部署使用。
它主要面向的使用场景是:构建RAG知识库时,批量抓取网页并清洗为纯文本。同类可对比的替代方案包括 Firecrawl、Jina Reader、Trafilatura。

一键把网页变成 LLM 能读懂的干净文本,RAG 抓取更省心。
llm-reader 是一个将网页转换为大语言模型友好文本输入的开源工具,定位类似 Firecrawl 和 Jina Reader API。它主要解决 RAG(检索增强生成)、AI 网页抓取、图片与网页链接提取等场景中,原始 HTML 噪声大、结构复杂导致 LLM 难以直接理解的问题。核心能力包括:自动提取网页正文、清洗无关元素(如导航、广告)、保留关键图片和链接信息,并输出为简洁的纯文本或 Markdown 格式,方便直接作为 LLM 的上下文输入。项目基于 Python 实现,提供简单易用的 API 接口,支持批量处理,适合开发者快速集成到自己的 AI 应用或数据处理管道中。作为早期项目,它聚焦于轻量化和易用性,为需要高质量网页文本提取的 RAG 系统提供了一种自托管替代方案。
Firecrawl、Jina Reader、Trafilatura
llm-reader 是搜索知识领域的开源项目,由 m92vyas 开发,2024 年首次发布。
它收录于搜索知识分类,该分类目前共有 585 个项目,GitHub 星标数为 311。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-24。MIT许可证,完全免费,需自行部署使用。
它主要面向的使用场景是:构建RAG知识库时,批量抓取网页并清洗为纯文本。同类可对比的替代方案包括 Firecrawl、Jina Reader、Trafilatura。
firecrawl
开源
网页抓取像喝水一样简单,开发者省下整周加班
The web data API to search, scrape, and interact at scale.
contoso-chat
开源
一键跑通 Azure RAG 应用,从代码到评估部署全流程
This sample has the full End2End process of creating RAG application with Prompty an···
graphify
开源
整个代码库画成一张图,找问题一眼定位
Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···
ragflow
开源
让大模型用上你的私有知识,搭建可靠的企业级RAG应用
RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···