
reader
把任意网页变成干净 Markdown,直接喂给 AI 智能体
Reader 是一套面向 AI 应用的开源 Web 基础设施,主要解决大模型和智能体在获取网页内容时遇到的脏数据、反爬拦截和会话管理难题。它提供抓取、爬取和自动化三类核心能力:单页抓取可把任意网页转成干净的 Markdown,方便直接喂给 LLM;批量爬取支持按站点遍历链接;自动化能力则基于无头浏览器维持登录态和浏览器会话,能处理需要交互或带反爬机制的页面。项目用 TypeScript 编写,定位是 Firecrawl 的开源替代方案,输出结构统一,可直接接入 AI Agent 的检索、数据抽取和网页操作流程,减少自建爬虫时在渲染、清洗和风控对抗上的重复投入。
项目数据
使用教程
核心亮点
- 内置 HTML 转 Markdown 清洗,输出可直接用于 LLM 上下文,省去二次解析
- 基于无头浏览器并支持浏览器会话,能应对登录态和部分反爬场景
- 抓取、爬取、自动化三类能力统一 API,TypeScript 技术栈对前端/Node 团队友好
不足之处
- 项目处于早期,星标和社区规模较小,长期维护与生态尚待观察
- 反爬对抗能力有限,面对强风控站点仍可能失败,需自行补充代理等方案
适用场景
- 为 RAG 或 AI 搜索构建网页内容采集与清洗管道
- 让 AI Agent 自动抓取指定站点并抽取结构化数据
- 需要登录态的网页自动化操作与批量内容同步
替代项目
Firecrawl、Crawl4AI、Jina Reader
项目介绍
上一篇:gpt-home
同类项目推荐
n8n
开源
拖拽搭建自动化流程,轻松接入 AI 与 400+ 应用,搞定重复工作。
Fair-code workflow automation platform with native AI capabilities. Combine visual b···
robotcode
开源
让 Robot Framework 拥有现代 IDE 体验,调试、补全、运行一气呵成。
Open Source Toolkit for Robot Framework, providing Language Server Protocol support,···
puppeteer
开源
用 JavaScript 轻松操控无头浏览器,搞定自动化测试与网页抓取。
JavaScript API for Chrome and Firefox
customermates
开源
比 Pipedrive 直观 10 倍的现代开源 CRM,轻松管理客户与自动化流程。
Building a modern alternative to Pipedrive that is 10x more intuitive.