web-scraper

本站收录 19 个带「web-scraper」标签的 AI 开源项目

firecrawl面向 AI 时代的上下文 API,提供大规模网页搜索、抓取与交互能力,让开发者轻松把互联网数据接入智能体应用,是 RAG 和 AI 工作流的数据入口利器。★ 186,524Agent-Reach为 AI 智能体装上“眼睛”:通过单一 CLI 即可读取与搜索 Twitter、Reddit、YouTube、GitHub、B站、小红书等全网平台内容,无需任何★ 86,165Scrapegraph-ai基于 AI 的 Python 爬虫库,用自然语言描述需求即可智能解析网页、提取结构化数据,大幅降低传统爬虫的编写与维护成本。★ 31,419maxunMaxun 是一个开源的零代码网页数据提取平台,专为需要快速从网站获取结构化数据的用户设计。它解决了传统爬虫开发门槛高、维护成本大的问题,让非技术人员也能通过可★ 17,595google-ai-mode-scraper该项目专为大规模抓取 Google AI Mode 的响应结果而设计,能够有效绕过反爬限制。对于需要批量获取 AI 搜索生成内容的开发者,它提供了稳定、可扩展的★ 3,627CyberScraper-2077CyberScraper-2077 是一个由大语言模型驱动的开源网络爬虫工具,支持 OpenAI、Gemini 和 Ollama 等主流 LLM 后端。它解决了★ 3,269molimoli 是一个专为 AI 智能体设计的无头浏览器,使用 Rust 语言开发,主打轻量、快速和高兼容性。它解决了 AI 代理在网页自动化任务中面临的速度慢、资源★ 2,658ai-scraper-pyAI Scraper 是一款功能强大的抓取工具与抓取智能体,以无与伦比的精度自动化数据提取,适合跨多种网页来源的大规模 AI 抓取任务。它把复杂的抓取流程简化为★ 1,092crwcrw 是一个用 Rust 编写的轻量级网络爬虫、抓取与搜索 API,旨在作为 Firecrawl 和 Tavily 的高性能替代品。它解决了 AI 智能体在获★ 1,091crwcrw 是一个用 Rust 编写的轻量级网页抓取、爬取与搜索 API,定位为 Firecrawl 和 Tavily 的开源替代品。它解决的是 AI 智能体获取实★ 1,091oxylabs-ai-studio-openclaw这是 Oxylabs AI Studio 的官方 OpenClaw 插件,将智能网页数据采集能力直接接入 OpenClaw 生态。用户可通过自然语言指令驱动抓取★ 549web-scraper-apiOxylabs Web Scraper API 是一站式网页抓取接口,专为实时、大规模数据提取设计。单次请求即可完成代理、CAPTCHA 处理、JavaScri★ 494markdown-crawlermarkdown-crawler 是一个用 Python 实现的多线程网络爬虫,能够递归抓取整个网站,并将每个页面转换为结构清晰的 Markdown 文件。它专★ 474teracrawlteracrawl 是一个专为大型语言模型(LLM)优化设计的高性能网页爬虫 API。它解决的核心问题是:LLM 应用需要从任意网站或搜索结果中提取干净、结构化★ 285web-scout-mcpweb-scout-mcp 是一个基于 JavaScript 的 MCP(模型上下文协议)服务器,为 AI 助手提供网页搜索和内容提取能力。它集成了 DuckD★ 134anansianansi 是一个面向恶意站点的自愈式爬虫工具,旨在解决传统爬虫在面对反爬机制时容易失效的问题。其核心能力包括:自动修复失效的 CSS 选择器,当静态解析失败★ 116chatgpt-web-scraping这是一个教学型项目,旨在教你如何编写ChatGPT提示词,让ChatGPT生成带正确CSS选择器的网页抓取代码。它解决的是非专业爬虫开发者难以编写复杂选择器的问★ 114Custom-MCP-ServerCustom-MCP-Server 是一个基于 Python 的 MCP 服务器,旨在为 AI 代理提供社交媒体和搜索引擎的数据抓取能力。它解决了 AI 代理无★ 98Scrapstyle粘贴一个网址,就能提取出一套完整的设计系统。为 Cursor 与 Lovable 生成可直接使用的 AI 风格指南,帮助开发者快速复用优秀网站的视觉语言,让 A★ 32