wxpath

用查询语言写爬虫,像查数据库一样抓网页数据

wxpath 是一个基于 XPath 的声明式网页爬取工具,它提出了一种称为 Web Query Language(WQL)的查询语言,让开发者可以用类似 SQL 的简洁语法来定义网页数据的提取规则。它解决了传统爬虫需要编写大量命令式代码(如 requests + BeautifulSoup 循环解析)的痛点,将数据提取过程抽象为声明式查询,从而降低爬虫开发门槛并提高代码可读性。核心能力包括:通过 XPath 定位网页元素、支持数据清洗与转换、支持多页面抓取与数据合并,并可能内置了请求调度和缓存机制。该项目处于早期阶段,星标数不多,但理念新颖,适合对声明式爬虫感兴趣的开发者探索。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 110
维护状态 维护中
是否开源
定价模式 free

项目数据

分类搜索知识
开发团队rodricios
所属国家
官网地址
定价模式free
价格说明开源项目,AGPL-3.0许可,可自行部署使用,完全免费。
访问状态
是否开源
开源协议AGPL-3.0
主要语言Python
技术栈/模型crawler,data-extraction,data-loader,data-mining,extract-data,rag,scraper,web-graph-traversal,web-query-language
GitHub 星标★ 110
30天Star增速
HF 下载量
上线时间2025-07-24 00:00:00
最近更新2026-08-22 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 声明式WQL语法,大幅简化爬虫代码,提升可读性
  • 基于XPath,精准定位网页元素,学习成本低
  • 内置数据转换和清洗能力,减少后处理工作

不足之处

  • 早期项目,文档和示例可能不完善
  • 社区生态未建立,遇到问题难以获得支持

适用场景

  • 快速构建结构化网页数据采集任务
  • 数据工程师进行网页数据抽取与清洗
  • 自动化测试中验证页面元素内容

替代项目

Scrapy、BeautifulSoup、lxml

项目介绍

wxpath 是自动化工作流领域的开源项目,由 rodricios 开发,2025 年首次发布。

它收录于自动化工作流分类,该分类目前共有 503 个项目,GitHub 星标数为 110。

项目仍在小幅维护中,最近一次代码更新于 2026-08-22。AGPL-3.0许可,可自行部署使用,完全免费。

它主要面向的使用场景是:快速构建结构化网页数据采集任务。同类可对比的替代方案包括 Scrapy、BeautifulSoup、lxml。

同类项目推荐

n8n 开源

拖拽搭建自动化流程,轻松接入 AI 与 400+ 应用,搞定重复工作。

Fair-code workflow automation platform with native AI capabilities. Combine visual b···

★ 205700 2026-08-10
feishu-docx 开源

让 AI 代理轻松读写飞书文档,双向转换 Markdown

Feishu/Lark Docs、Sheet、Bitable <-> Markdown | AI Agent-friendly knowledge base exp···

★ 261 2026-08-09
robotcode 开源

让 Robot Framework 拥有现代 IDE 体验,调试、补全、运行一气呵成。

Open Source Toolkit for Robot Framework, providing Language Server Protocol support,···

★ 300 2026-08-10
puppeteer 开源

用 JavaScript 轻松操控无头浏览器,搞定自动化测试与网页抓取。

JavaScript API for Chrome and Firefox

★ 95609 2026-08-10