webclaw

本地快速抓网页,一键转 Markdown 喂给大模型

webclaw 是一个用 Rust 编写的本地优先网页内容提取工具,专为 LLM 设计。它解决的是大模型应用开发中网页数据获取难、格式杂乱的问题,能将网页高效转换为干净的 Markdown 或结构化数据。核心能力包括网页抓取、爬虫、结构化数据提取,并提供 CLI、REST API 和 MCP 服务器三种使用方式,方便集成到各种 AI 工作流中。相比同类工具,它强调本地运行、速度快、资源占用低,是 Firecrawl 的开源替代方案。

开源 unknown 智能体
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2360
维护状态 活跃
是否开源
定价模式 unknown

项目数据

分类智能体
开发团队0xMassi
所属国家
官网地址https://webclaw.io
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议AGPL-3.0
主要语言Rust
技术栈/模型ai-agents,ai-scraping,apify-alternative,cli,crawl4ai-alternative,firecrawl-alternative,html-to-markdown,jina-alternative,llm,markdown,mcp,mcp-server,rust,scraperapi-alternative,scrapingbee-alternative,self-hosted,tls-fingerprinting,web-crawler,web-extraction,web-scraping
GitHub 星标★ 2360
30天Star增速
HF 下载量
上线时间2026-03-10 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 4 步

环境要求

  • 可运行 npx 的 Node.js 环境(用于 create-webclaw 安装器)
  • Docker(可选,用于容器方式运行)
  • 支持 MCP 的客户端,如 Claude Code、Claude Desktop、Cursor、Windsurf、OpenCode、Codex CLI
  • 可访问 npm 与 ghcr.io 镜像源的网络环境

安装与启动步骤

  1. 1准备运行环境

    确认已安装 Node.js(提供 npx)以便运行官方安装器;若只想快速试用,也可以改用 Docker 方式运行,无需 Node.js。

  2. 2一键接入 MCP 客户端

    这是官方说明中最快的接入方式,安装器会自动检测受支持的客户端并帮你配置好 MCP 服务器,按提示操作即可。

    npx create-webclaw
  3. 3用 Docker 快速试用

    无需安装,直接拉取官方镜像并抓取一个示例网页,命令末尾参数是目标网址,可替换为你自己的页面。

    docker run --rm ghcr.io/0xmassi/webclaw https://example.com
  4. 4按需配置密钥与代理

    如需托管 API、LLM 能力或代理池,在运行环境或 MCP 客户端配置中设置下表中的环境变量,按实际使用的服务填写。

关键配置

配置项必填说明示例
WEBCLAW_API_KEY使用托管版 webclaw.io 服务时的 API Keysk-xxxxxxxx
OPENAI_API_KEYOpenAI 兼容的 LLM 提供方密钥sk-xxxxxxxx
OPENAI_BASE_URLOpenAI 兼容接口的 Base URLhttps://api.openai.com/v1
ANTHROPIC_API_KEYAnthropic 兼容的 LLM 提供方密钥sk-ant-xxxxxxxx
OLLAMA_HOST本地 Ollama 地址,用于本地 LLM 功能http://localhost:11434
WEBCLAW_PROXY单个代理 URL,用于受限网络访问http://127.0.0.1:7890

如何确认成功

执行 npx create-webclaw 后应看到安装器识别并配置好 MCP 客户端;运行 Docker 命令应返回该网页的 Markdown 内容。

常见问题

Q:没有安装 Node.js 怎么办?

A:可以跳过 npx 方式,直接用 README 给出的 Docker 命令运行,同样能抓取网页并输出 Markdown。

Q:npx create-webclaw 会自动改我的配置吗?

A:会。README 说明该安装器会检测受支持的客户端并自动为其配置 MCP 服务器,接入前建议先备份原配置。

Q:Docker 命令最后的网址必须用 example.com 吗?

A:不是,那只是示例。把它替换成你要提取内容的任意网页地址即可。

Q:想用本地大模型怎么做?

A:设置 OLLAMA_HOST 指向你的 Ollama 服务地址,即可启用本地 LLM 相关能力,无需外部密钥。

Q:抓取受网络限制的站点怎么办?

A:可配置 WEBCLAW_PROXY 指定单个代理,或用 WEBCLAW_PROXY_FILE 指定代理池文件。

注意事项

  • README 节选未给出 CLI 的详细参数与 REST API 用法,完整文档请访问官网 https://webclaw.io。
  • 环境变量属于可选配置:仅使用网页转 Markdown 的基础功能时可不设置任何密钥。
  • 通过 MCP 客户端调用时,环境变量需写在客户端对应的配置中,而不是临时终端里。

核心亮点

  • Rust 实现,性能高,内存占用低,本地运行隐私好
  • 提供 CLI、REST API、MCP 服务器三种接口,集成灵活
  • 支持抓取、爬虫、结构化提取,功能全面,对标 Firecrawl

不足之处

  • 生态和文档相比成熟项目(如 Firecrawl)仍待完善
  • 高级功能(如 JS 渲染)可能依赖额外配置,上手有门槛

适用场景

  • 为 RAG 应用批量抓取网页并转为干净文本
  • 作为 MCP 工具接入 Claude 等 AI 助手实时获取网页信息
  • 本地自动化爬取网站数据,生成结构化 JSON 供分析

替代项目

Firecrawl、Trafilatura、Scrapy

项目介绍

webclaw 是基础设施领域的开源项目,由 0xMassi 开发,是 2026 年新上线的项目。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,360)位列前 30%,在基础设施分类中处于中上游。

近 45 天,它的 GitHub 星标从 2,123 增加到 2,360,净增 237。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。从国内网络环境看,可直接访问。

它主要面向的使用场景是:为RAG应用批量抓取网页并转为干净文本。同类可对比的替代方案包括 Firecrawl、Trafilatura、Scrapy。

上一篇:liveblocks

下一篇:numbat

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09