webscraping
本站收录 18 个带「webscraping」标签的 AI 开源项目
firecrawl面向 AI 时代的上下文 API,提供大规模网页搜索、抓取与交互能力,让开发者轻松把互联网数据接入智能体应用,是 RAG 和 AI 工作流的数据入口利器。★ 186,524
CloakBrowserCloakBrowser 是一个基于 Chromium 的隐身浏览器,专为绕过各类机器人检测而设计。它通过源码级别的指纹修补,使自动化浏览器在网站眼中与真实用户★ 31,792
Scrapegraph-ai基于 AI 的 Python 爬虫库,用自然语言描述需求即可智能解析网页、提取结构化数据,大幅降低传统爬虫的编写与维护成本。★ 31,419
gpt-researcherGPT Researcher 是一个开源的自主研究智能体,能针对任意主题自动完成资料检索、网页抓取、信息筛选与报告撰写。它解决的是传统人工调研耗时、信息碎片化、★ 29,706
maxunMaxun 是一个开源的零代码网页数据提取平台,专为需要快速从网站获取结构化数据的用户设计。它解决了传统爬虫开发门槛高、维护成本大的问题,让非技术人员也能通过可★ 17,595
SeleniumBaseSeleniumBase 是一个基于 Python 的浏览器自动化框架,在原生 Selenium 之上做了大量封装,用于网页抓取、端到端测试和自动化工作流。它最★ 13,047
CyberScraper-2077CyberScraper-2077 是一个由大语言模型驱动的开源网络爬虫工具,支持 OpenAI、Gemini 和 Ollama 等主流 LLM 后端。它解决了★ 3,269
invisible_playwrightinvisible_playwright 是一个面向 Playwright 的开源反检测浏览器隐身工具,主要解决网页自动化过程中被反爬虫机制识别和拦截的问题。它★ 2,983
EasyApplyJobsBotEasyApplyJobsBot 是一个基于 Python 的自动化求职机器人,主要解决求职者手动在 LinkedIn、Glassdoor、Indeed 等平台★ 827
ovobrowserovobrowser 是一个从 Chromium 源码层改造的浏览器指纹内核,目标是让自动化浏览器在各类反爬与风控检测站上被判定为普通 Chrome,而不是被识★ 596
oxylabs-ai-studio-openclaw这是 Oxylabs AI Studio 的官方 OpenClaw 插件,将智能网页数据采集能力直接接入 OpenClaw 生态。用户可通过自然语言指令驱动抓取★ 549
extractorextractor 是一个基于 TypeScript 的开源工具,利用大语言模型(LLM)从网页中稳健地提取结构化数据。它解决了传统网页爬虫依赖固定选择器、易受★ 321
ChatGPT-OpenAI-Smart-Speaker这是一个基于Python的开源AI智能音箱项目,旨在将普通音箱升级为支持语音和视觉交互的智能助手。它利用OpenAI的GPT-4模型,结合语音识别(STT)、文★ 316
llm-readerllm-reader 是一个将网页转换为大语言模型友好文本输入的开源工具,定位类似 Firecrawl 和 Jina Reader API。它主要解决 RAG(★ 311
readerreader 是 Jina AI Reader 的本地化改编版本,通过 Docker 实现一键部署,将任意网页 URL 转换为大语言模型友好的输入格式。它解决的★ 307
AutomatiQAutomatiQ 是一个针对网页的 AI 助手逆向工程工具,用 Python 编写。它解决的核心问题是:当现有 AI 助手或自动化工具无法满足特定网页交互需求★ 168
clearcote-browserclearcote-browser 是一个开源的隐身 Chromium 浏览器,核心目标是在引擎层面伪造浏览器指纹,让自动化脚本和爬虫更难被网站识别与封禁。它基★ 168
AI_Manga_ReaderAI_Manga_Reader 是一款基于 MangaDex API 的下一代漫画阅读应用,旨在解决跨语言漫画阅读和听力辅助问题。它利用 AI 驱动的 OCR ★ 57