llm-reader

一键把网页变成 LLM 能读懂的干净文本,RAG 抓取更省心。

llm-reader 是一个将网页转换为大语言模型友好文本输入的开源工具,定位类似 Firecrawl 和 Jina Reader API。它主要解决 RAG(检索增强生成)、AI 网页抓取、图片与网页链接提取等场景中,原始 HTML 噪声大、结构复杂导致 LLM 难以直接理解的问题。核心能力包括:自动提取网页正文、清洗无关元素(如导航、广告)、保留关键图片和链接信息,并输出为简洁的纯文本或 Markdown 格式,方便直接作为 LLM 的上下文输入。项目基于 Python 实现,提供简单易用的 API 接口,支持批量处理,适合开发者快速集成到自己的 AI 应用或数据处理管道中。作为早期项目,它聚焦于轻量化和易用性,为需要高质量网页文本提取的 RAG 系统提供了一种自托管替代方案。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 311
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队m92vyas
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,需自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型ai-agent-tools,ai-agents,ai-web-scraper,extract-data,firecrawl,jinaai,llm,llm-agent,rag,scraper,scraping,scraping-websites,webscraping
GitHub 星标★ 311
30天Star增速
HF 下载量
上线时间2024-07-27 00:00:00
最近更新2026-09-24 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数0

使用教程

核心亮点

  • 输出格式针对 LLM 优化,直接减少 token 浪费,提升 RAG 检索质量
  • 支持图片和链接提取,保留关键上下文,不丢失网页中的多模态信息
  • 自托管部署,数据不出内网,相比第三方 API 更安全可控

不足之处

  • 早期项目,功能迭代和稳定性有待验证
  • 文档/社区待观察

适用场景

  • 构建 RAG 知识库时,批量抓取网页并清洗为纯文本
  • AI 爬虫中需要将动态或复杂网页转为结构化文本供模型分析
  • 个人或企业内网部署,避免将网页内容发送给外部 API

替代项目

Firecrawl、Jina Reader、Trafilatura

项目介绍

llm-reader 是搜索知识领域的开源项目,由 m92vyas 开发,2024 年首次发布。

它收录于搜索知识分类,该分类目前共有 585 个项目,GitHub 星标数为 311。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-24。MIT许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:构建RAG知识库时,批量抓取网页并清洗为纯文本。同类可对比的替代方案包括 Firecrawl、Jina Reader、Trafilatura。

上一篇:A-Guide-to-Retrieval-Augmented-LLM

下一篇:SARA

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
ragflow 开源

让大模型用上你的私有知识,搭建可靠的企业级RAG应用

RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···

★ 91170 2026-08-09