LLMWebCrawler

用LLM智能抓取网页,直接喂给RAG做知识库

LLMWebCrawler 是一个基于大语言模型的智能网络爬虫,使用 Ray 实现分布式并行抓取,并借助 Huggingface 的嵌入模型将网页内容向量化后存入向量数据库,支持快速聚类和检索。它主要解决传统爬虫抓取内容质量低、无法理解语义、难以直接用于 RAG(检索增强生成)的问题。核心能力包括:通过 LLM 自动筛选和提取网页关键信息,生成高质量嵌入向量;利用向量数据库实现内容的语义去重和快速检索;结合 Ray 实现可扩展的分布式爬取,适合大规模数据采集。项目处于早期阶段,代码结构清晰,适合开发者二次开发,用于构建知识库、智能问答系统或垂直领域数据管道。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 106
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队Aavache
所属国家
官网地址
定价模式free
价格说明开源项目,基于LLM的网页爬虫,需自行部署,完全免费。
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型api,distributed-computing,fastapi,huggingface,large-language-models,llm,machine-learning,milvus,nlp,pydantic,python,rag,ray,raylib,transformer,vector-database,webcrawler,webcrawling
GitHub 星标★ 106
30天Star增速
HF 下载量
上线时间2023-09-28 00:00:00
最近更新2026-09-18 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数0

使用教程

核心亮点

  • LLM驱动内容理解,自动过滤低质页面,提取关键信息
  • 基于Ray分布式架构,可横向扩展抓取规模
  • 嵌入向量存入向量库,支持语义去重和快速检索

不足之处

  • 文档/社区待观察
  • 早期项目,功能完整性和稳定性未充分验证

适用场景

  • 构建企业知识库,自动抓取内部文档和外部网页
  • 为RAG应用收集高质量语料,减少人工清洗
  • 垂直领域数据监控,如新闻、竞品信息聚合

替代项目

Scrapy、Crawlee、Firecrawl

项目介绍

LLMWebCrawler 是搜索知识领域的开源项目,由 Aavache 开发,2023 年首次发布。

它收录于搜索知识分类,该分类目前共有 585 个项目,GitHub 星标数为 106。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-18。基于LLM的网页爬虫,需自行部署,完全免费。

它主要面向的使用场景是:构建企业知识库,自动抓取内部文档和外部网页。同类可对比的替代方案包括 Scrapy、Crawlee、Firecrawl。

上一篇:RAG-Play

下一篇:quanta-quest

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
ragflow 开源

让大模型用上你的私有知识,搭建可靠的企业级RAG应用

RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···

★ 91170 2026-08-09