web-scraping
本站收录 73 个带「web-scraping」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
firecrawl面向 AI 时代的上下文 API,提供大规模网页搜索、抓取与交互能力,让开发者轻松把互联网数据接入智能体应用,是 RAG 和 AI 工作流的数据入口利器。★ 186,524
crawl4aiCrawl4AI 是一个面向大语言模型的开源网页爬虫与抓取工具,用 Python 编写。它解决的核心问题是:传统爬虫抓下来的 HTML 噪声大、结构乱,直接喂给★ 84,413
ai-website-cloner-template这是一个基于 AI 编程代理的网站克隆模板,用户只需一条命令即可克隆任意网站。它利用 Claude Code 等 AI 代理,通过反向工程目标网站的 HTML、★ 35,444
CloakBrowserCloakBrowser 是一个基于 Chromium 的隐身浏览器,专为绕过各类机器人检测而设计。它通过源码级别的指纹修补,使自动化浏览器在网站眼中与真实用户★ 31,792
Scrapegraph-ai基于 AI 的 Python 爬虫库,用自然语言描述需求即可智能解析网页、提取结构化数据,大幅降低传统爬虫的编写与维护成本。★ 31,419
crawleeCrawlee 是 Apify 开源的 Node.js 网页抓取与浏览器自动化库,用 JavaScript/TypeScript 编写,目标是让开发者快速构建稳★ 25,949
stagehandStagehand 是一个基于 TypeScript 的浏览器自动化 SDK,把 Playwright 的底层控制能力与大模型驱动的自然语言指令结合起来,让开发★ 25,462
maxunMaxun 是一个开源的零代码网页数据提取平台,专为需要快速从网站获取结构化数据的用户设计。它解决了传统爬虫开发门槛高、维护成本大的问题,让非技术人员也能通过可★ 17,595
SurfSenseSurfSense 是一个开源的 NotebookLM 替代品,旨在帮助用户通过单一平台、API 或 MCP 服务器,实时研究开放网络上的数据。它集成了 Red★ 16,296
Skill_SeekersSkill_Seekers 是一个将文档网站、GitHub 仓库和 PDF 自动转换为 Claude AI 技能(Skills)的开源工具。它解决了手动编写 C★ 15,046
SeleniumBaseSeleniumBase 是一个基于 Python 的浏览器自动化框架,在原生 Selenium 之上做了大量封装,用于网页抓取、端到端测试和自动化工作流。它最★ 13,047
camofox-browserCamoufox 是一个专为 AI 智能体设计的隐形无头浏览器,旨在解决网页自动化中常见的反爬虫和机器人检测问题。它作为 Puppeteer 和 Playwri★ 11,264
pinchtabpinchtab 是一个高性能的浏览器自动化桥接与多实例编排工具,基于 Go 语言实现,通过 CDP 协议控制无头 Chrome 浏览器。它解决了大规模网页抓取★ 10,321
crawlee-pythonCrawlee 是 Apify 推出的 Python 网页抓取与浏览器自动化库,目标是让开发者用一套统一 API 构建稳定可靠的爬虫。它解决的核心问题是:传统爬★ 9,569
pydollPydoll 是一个基于 Python 的浏览器自动化库,专为 Chromium 系浏览器设计,无需 WebDriver 即可通过 CDP 协议直接控制浏览器。★ 7,105
trafilaturaTrafilatura 是一个用 Python 编写的网页文本与元数据抓取工具,同时提供命令行接口。它解决的核心问题是:从杂乱无章的 HTML 页面中精准提取正★ 6,890
skillsskills 是一个专为 AI 智能体设计的浏览器自动化命令行工具。它主要解决 AI 智能体在访问网页时遭遇反爬虫拦截、无法完成复杂交互操作的问题。其核心能力包★ 6,040
ferretFerret 是一个声明式的数据自动化语言及 Go 运行时,旨在简化结构化数据提取工作流。它通过自定义 DSL 让用户以声明式方式描述从网页或文档中提取数据的逻★ 6,013
wigolowigolo 是一个面向 AI 编程代理的本地优先搜索与检索工具,通过 MCP 协议为 Claude 等智能体提供网络搜索、网页抓取、爬虫和研究能力。它解决了 ★ 5,427
oxylabs-ai-studio-pyOxylabs AI Studio 的 Python SDK,通过 AI 驱动的抓取器、爬虫和浏览器自动化,从任意网站收集结构化数据。支持用自然语言指令完成抓取★ 3,396
spiderspider 是一个用 Rust 编写的开源网络爬虫引擎,专为 AI 智能体和大型语言模型设计,用于高效获取网页数据。它解决了传统爬虫在数据提取、并发处理和反爬★ 2,747
brightdata-mcpbrightdata-mcp 是一个基于 Model Context Protocol (MCP) 的服务器,为 AI 应用提供统一的公共网络访问能力。它解决了★ 2,662
molimoli 是一个专为 AI 智能体设计的无头浏览器,使用 Rust 语言开发,主打轻量、快速和高兼容性。它解决了 AI 代理在网页自动化任务中面临的速度慢、资源★ 2,658
webclawwebclaw 是一个用 Rust 编写的本地优先网页内容提取工具,专为 LLM 设计。它解决的是大模型应用开发中网页数据获取难、格式杂乱的问题,能将网页高效转★ 2,366
HeadlessXHeadlessX 是一个基于 Camoufox(Firefox 内核)的自托管浏览器自动化平台,主打“零检测率”和隐私保护。它解决了传统无头浏览器(如 Pup★ 2,325
stealth-browser-mcpstealth-browser-mcp 是一个基于 Python 的浏览器自动化工具,专为绕过反机器人系统而设计。它通过 AI 代理(如 Claude)与浏览器★ 2,162
agentqlAgentQL 是一套用于将 AI 连接到网页的工具集,核心是提供一种类似 SQL 的查询语言,让开发者能通过自然语言描述网页元素或数据,再结合 Playwri★ 1,471
WebAI2APIWebAI2API 是一个基于 Camoufox 浏览器自动化框架的开源工具,旨在将网页版 AI 服务(如 LMArena、Gemini 等)封装成标准的 Op★ 1,370
crwcrw 是一个用 Rust 编写的轻量级网络爬虫、抓取与搜索 API,旨在作为 Firecrawl 和 Tavily 的高性能替代品。它解决了 AI 智能体在获★ 1,091
crwcrw 是一个用 Rust 编写的轻量级网页抓取、爬取与搜索 API,定位为 Firecrawl 和 Tavily 的开源替代品。它解决的是 AI 智能体获取实★ 1,091
chatgpt-scraper-apichatgpt-scraper-api 是一个基于 ChatGPT 的智能抓取 API 工具,它允许开发者通过简单的 API 调用,利用 ChatGPT 的语义★ 1,057
agent-skillsagent-skills 是 Oxylabs 官方开源的智能体技能集合,用 JavaScript 编写,面向 Claude Code、Claude Skills★ 876
neoneo 是一个将任意网页应用转化为 API 的 Chrome 扩展。它通过捕获浏览器中的网络流量,自动生成接口模式(schema),并允许 AI 直接重放这些 ★ 756
gpt-promo-scannergpt-promo-scanner 是一个针对 ChatGPT Team 和 Business 订阅的促销码自动扫描工具。它解决的是用户难以发现和验证 Chat★ 756
ketchketch 是一个用 Go 编写的快速、无状态的命令行工具,专为 AI 代理设计,用于网页搜索和抓取。它解决了 AI 代理在获取实时网络信息时面临的效率低、状态★ 675
headless-browserOxylabs Headless Browser 通过远程云端会话执行复杂自动化脚本,内置住宅代理、自动 CAPTCHA 破解与原生 JavaScript 渲染★ 667
ovobrowserovobrowser 是一个从 Chromium 源码层改造的浏览器指纹内核,目标是让自动化浏览器在各类反爬与风控检测站上被判定为普通 Chrome,而不是被识★ 596
readerReader 是一套面向 AI 应用的开源 Web 基础设施,主要解决大模型和智能体在获取网页内容时遇到的脏数据、反爬拦截和会话管理难题。它提供抓取、爬取和自动★ 560
browser-searchbrowser-search 是一个为 AI 智能体设计的开源技能包,旨在让 AI 具备真实、可靠的联网搜索与浏览能力。它通过集成 SearXNG 元搜索引擎实★ 527
web-scraper-apiOxylabs Web Scraper API 是一站式网页抓取接口,专为实时、大规模数据提取设计。单次请求即可完成代理、CAPTCHA 处理、JavaScri★ 494
AI-Search-pyAI-Search 将普通英语查询转化为结构化网页数据,支持自动 Markdown 提取与完整 JavaScript 渲染,可轻松处理动态网站。它把自然语言搜索★ 423
oxylabs-ai-studio-jsOxylabs AI Studio 的 JavaScript SDK,通过 AI 驱动的抓取器、爬虫与浏览器自动化,从任意网站收集结构化数据。支持自然语言指令完★ 411
camofox-browserCamofox Browser 是一个面向 AI 智能体的反检测浏览器服务器,它通过 REST API 封装了 Camoufox 引擎,并提供 OpenClaw★ 404
camoufox-clicamoufox-cli 是一个基于 Camoufox 反检测浏览器的命令行工具与技能包,专为 AI Agent 和自动化脚本设计。它解决的核心问题是:传统 P★ 350
MinerU-HTMLMinerU-HTML 是一个基于小型语言模型(SLM)的 HTML 主内容提取工具,能够从杂乱网页中提取干净的 HTML 正文。它解决的是网页内容解析中常见的★ 293
teracrawlteracrawl 是一个专为大型语言模型(LLM)优化设计的高性能网页爬虫 API。它解决的核心问题是:LLM 应用需要从任意网站或搜索结果中提取干净、结构化★ 285
Uni-CLIUni-CLI 是一个面向 AI 代理的统一命令行接口工具,旨在解决 AI 代理在操作多种软件界面时缺乏统一入口的问题。它允许用户通过一条命令搜索、运行和检查跨★ 270
searcharvestersearcharvester 是一个面向 AI 代理的自托管搜索与网页内容抓取服务,将 SearXNG 的 100+ 搜索引擎聚合能力与 trafilatura★ 263
pocketgroqPocketGroq 是一个 Python 库,旨在简化 Groq API 的集成,让开发者能快速构建基于大语言模型的对话、推理和自动化代理应用。它解决了直接调★ 217