reader

给 URL 加个前缀,网页秒变 LLM 能读的 Markdown

reader 是一个将任意网页 URL 转换为大语言模型友好输入的开源工具,通过简单的 URL 前缀 https://r.jina.ai/ 即可调用。它解决了 LLM 在读取网页时面临的 HTML 噪音、结构混乱、内容提取困难等问题,将网页内容自动清洗、提取正文、去除广告和导航,并输出为干净的 Markdown 格式。核心能力包括:支持任意公开网页的实时抓取与转换、自动处理 JavaScript 渲染页面、提供 RESTful API 接口、可自定义提取规则和输出格式。项目基于 TypeScript 开发,部署灵活,既可作为公共服务使用,也可自托管。其设计初衷是让开发者无需编写复杂的爬虫或解析代码,就能快速将网页内容接入 LLM 工作流,适用于 RAG、知识库构建、AI 阅读助手等场景。

开源 freemium 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 12031
维护状态 低维护
是否开源
定价模式 freemium

项目数据

分类开源模型
开发团队jina-ai
所属国家
定价模式freemium
价格说明提供免费额度,超出部分按量付费,具体价格需查看官网。
访问状态
是否开源
开源协议Apache-2.0
主要语言TypeScript
技术栈/模型llm,proxy
GitHub 星标★ 12031
30天Star增速
HF 下载量
上线时间2024-04-10 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:Docker 6 步

环境要求

  • 已安装 Docker,可运行 docker pull / docker run
  • 主机能访问 GitHub Container Registry(ghcr.io)
  • 仅使用公共 API 时无需安装,只要能访问 r.jina.ai 和 s.jina.ai
  • 若要启用桶缓存,需要有一个 S3 兼容的对象存储桶

安装与启动步骤

  1. 1调用公共 Read 接口

    在任意公开网页 URL 前加上 https://r.jina.ai/ 前缀,即可拿到清洗后的 LLM 友好输入(Markdown)。免费、无需注册。

    curl https://r.jina.ai/https://github.com/jina-ai/reader
  2. 2调用公共 Search 接口

    把查询词拼在 https://s.jina.ai/ 后面,即可让模型检索到最新的网络信息。空格等特殊字符需转义。

    curl "https://s.jina.ai/Who%20will%20win%202024%20US%20presidential%20election%3F"
  3. 3拉取自托管镜像

    开源分支的预构建镜像已发布到 ghcr.io,内置 headless Chrome、LibreOffice 和 CJK 字体,无需自行构建。

    docker pull ghcr.io/jina-ai/reader:oss
  4. 4启动容器

    镜像暴露 8080(h2c)和 8081(HTTP/1.1)两个端口。用 curl 或浏览器测试时映射 HTTP/1.1 的 8081。

    docker run --rm -p 3000:8081 ghcr.io/jina-ai/reader:oss
  5. 5带缓存启动

    指向一个 S3 兼容存储桶后,抓取过的页面会被缓存,多次请求之间复用,减少重复抓取。

    docker run --rm -p 3000:8081 
      -e GCP_STORAGE_ENDPOINT=https://s3.example.com 
      -e GCP_STORAGE_BUCKET=reader-cache 
      -e GCP_STORAGE_ACCESS_KEY=your-access-key 
      -e GCP_STORAGE_SECRET_KEY=your-secret-key 
      ghcr.io/jina-ai/reader:oss
  6. 6查阅环境变量表

    镜像支持的其他环境变量未在 README 正文列出,需按 README 指引查看 CONTRIBUTING.md 中的完整环境变量表。

    git clone https://github.com/jina-ai/reader.git

关键配置

配置项必填说明示例
GCP_STORAGE_ENDPOINTS3 兼容对象存储的访问端点https://s3.example.com
GCP_STORAGE_BUCKET用于缓存已抓取页面的存储桶名称reader-cache
GCP_STORAGE_ACCESS_KEY对象存储的访问密钥 IDyour-access-key
GCP_STORAGE_SECRET_KEY对象存储的访问密钥 Secretyour-secret-key

如何确认成功

容器启动后,用 curl 或浏览器访问 http://localhost:3000 有正常响应即成功;公共接口可先验证 r.jina.ai 前缀链接是否返回内容。

常见问题

Q:调用公共 API 需要 API Key 吗?

A:README 未要求 Key。Reader API 可免费用于生产环境,稳定且可扩展,但存在速率限制,具体见官网定价页。

Q:8080 和 8081 端口该用哪个?

A:8080 是 h2c(HTTP/2 明文),是 Cloud Run 使用的生产级端口,普通 curl 需加 --http2-prior-knowledge;8081 是 HTTP/1.1 回退端口,路由相同,curl 和浏览器用这个。

Q:自托管版和线上 r.jina.ai 有什么区别?

A:本仓库是线上服务背后的开源分支,运行在无状态或桶缓存模式,不含 MongoDB 支撑的 SaaS 存储层,可自行部署。

Q:能否处理 PDF 和 Office 文档?

A:可以。README 更新记录显示存储层已解耦并支持二进制文件上传,包括 PDF 以及 Word、Excel、PowerPoint 等 MS Office 文档。

注意事项

  • 开源分支默认以无状态模式开箱运行,如需缓存可选用 MinIO/S3 兼容桶,通过 docker compose 或环境变量配置。
  • README 的 Usage 章节为空,本地开发(local development)细节未在节选中给出,需自行查看仓库中的 CONTRIBUTING.md。
  • 全部环境变量的完整表格见 CONTRIBUTING.md 的 environment-variables 小节。
  • 公共 API 有速率限制,生产使用前建议先了解官网定价页的限额说明。

核心亮点

  • 零代码接入:只需在 URL 前加 https://r.jina.ai/ 即可,无需安装或配置
  • 自动清洗网页:去除广告、导航、脚本等噪音,提取核心正文内容
  • 支持 JavaScript 渲染页面,能处理动态内容,比普通爬虫更全面

不足之处

  • 免费公共实例有速率限制,高频调用需自托管或付费
  • 对复杂登录墙或反爬严格的网站,提取效果可能不稳定

适用场景

  • 构建 RAG 知识库时快速抓取网页内容并向量化
  • 为 AI 阅读助手提供干净的网页正文输入
  • 批量采集新闻、博客等文章用于大模型微调或分析

替代项目

Firecrawl、Jina AI Reader(同项目)、Trafilatura

项目介绍

reader 是搜索知识领域的开源项目,由 jina-ai 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(12,031)位列前 5%,在搜索知识分类的 581 个项目里位列前 6%。

近 41 天,它的 GitHub 星标从 11,855 增加到 12,031,净增 176。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。提供免费额度,超出部分按量付费,具体价格需查看官网。

它主要面向的使用场景是:构建RAG知识库时快速抓取网页内容并向量化。同类可对比的替代方案包括 Firecrawl、Jina AI Reader(同项目)、Trafilatura。

上一篇:pandas-ai

下一篇:PandaWiki

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
ragflow 开源

让大模型用上你的私有知识,搭建可靠的企业级RAG应用

RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···

★ 91170 2026-08-09