LLMWebCrawler 是搜索知识领域的开源项目,由 Aavache 开发,2023 年首次发布。
它收录于搜索知识分类,该分类目前共有 585 个项目,GitHub 星标数为 106。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-18。基于LLM的网页爬虫,需自行部署,完全免费。
它主要面向的使用场景是:构建企业知识库,自动抓取内部文档和外部网页。同类可对比的替代方案包括 Scrapy、Crawlee、Firecrawl。

用LLM智能抓取网页,直接喂给RAG做知识库
LLMWebCrawler 是一个基于大语言模型的智能网络爬虫,使用 Ray 实现分布式并行抓取,并借助 Huggingface 的嵌入模型将网页内容向量化后存入向量数据库,支持快速聚类和检索。它主要解决传统爬虫抓取内容质量低、无法理解语义、难以直接用于 RAG(检索增强生成)的问题。核心能力包括:通过 LLM 自动筛选和提取网页关键信息,生成高质量嵌入向量;利用向量数据库实现内容的语义去重和快速检索;结合 Ray 实现可扩展的分布式爬取,适合大规模数据采集。项目处于早期阶段,代码结构清晰,适合开发者二次开发,用于构建知识库、智能问答系统或垂直领域数据管道。
Scrapy、Crawlee、Firecrawl
LLMWebCrawler 是搜索知识领域的开源项目,由 Aavache 开发,2023 年首次发布。
它收录于搜索知识分类,该分类目前共有 585 个项目,GitHub 星标数为 106。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-18。基于LLM的网页爬虫,需自行部署,完全免费。
它主要面向的使用场景是:构建企业知识库,自动抓取内部文档和外部网页。同类可对比的替代方案包括 Scrapy、Crawlee、Firecrawl。
上一篇:RAG-Play
下一篇:quanta-quest
firecrawl
开源
网页抓取像喝水一样简单,开发者省下整周加班
The web data API to search, scrape, and interact at scale.
contoso-chat
开源
一键跑通 Azure RAG 应用,从代码到评估部署全流程
This sample has the full End2End process of creating RAG application with Prompty an···
graphify
开源
整个代码库画成一张图,找问题一眼定位
Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···
ragflow
开源
让大模型用上你的私有知识,搭建可靠的企业级RAG应用
RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···