scraping

本站收录 24 个带「scraping」标签的 AI 开源项目

firecrawl面向 AI 时代的上下文 API,提供大规模网页搜索、抓取与交互能力,让开发者轻松把互联网数据接入智能体应用,是 RAG 和 AI 工作流的数据入口利器。★ 186,524Scrapegraph-ai基于 AI 的 Python 爬虫库,用自然语言描述需求即可智能解析网页、提取结构化数据,大幅降低传统爬虫的编写与维护成本。★ 31,419crawleeCrawlee 是 Apify 开源的 Node.js 网页抓取与浏览器自动化库,用 JavaScript/TypeScript 编写,目标是让开发者快速构建稳★ 25,949camofox-browserCamoufox 是一个专为 AI 智能体设计的隐形无头浏览器,旨在解决网页自动化中常见的反爬虫和机器人检测问题。它作为 Puppeteer 和 Playwri★ 11,264crawlee-pythonCrawlee 是 Apify 推出的 Python 网页抓取与浏览器自动化库,目标是让开发者用一套统一 API 构建稳定可靠的爬虫。它解决的核心问题是:传统爬★ 9,569pydollPydoll 是一个基于 Python 的浏览器自动化库,专为 Chromium 系浏览器设计,无需 WebDriver 即可通过 CDP 协议直接控制浏览器。★ 7,105trafilaturaTrafilatura 是一个用 Python 编写的网页文本与元数据抓取工具,同时提供命令行接口。它解决的核心问题是:从杂乱无章的 HTML 页面中精准提取正★ 6,890AnyCrawlAnyCrawl 是一个基于 Node.js/TypeScript 的开源爬虫工具,主要解决将网站内容转化为大语言模型(LLM)可用的结构化数据,以及从 Goo★ 3,464spiderspider 是一个用 Rust 编写的开源网络爬虫引擎,专为 AI 智能体和大型语言模型设计,用于高效获取网页数据。它解决了传统爬虫在数据提取、并发处理和反爬★ 2,747brightdata-mcpbrightdata-mcp 是一个基于 Model Context Protocol (MCP) 的服务器,为 AI 应用提供统一的公共网络访问能力。它解决了★ 2,662untidetect-tools这是一个收录反检测与浏览器指纹伪装工具的资源列表,主要面向需要绕过网站反爬虫、验证码和人机识别机制的用户。项目整理了各类反检测浏览器(如基于Chromium的指★ 2,015thepipethepipe 是一个基于视觉语言模型(VLM)的文档数据清洗工具,专门解决从复杂文档(如扫描件、PDF、PPT、表格、手写笔记等)中提取干净结构化数据的问题。★ 1,529agentqlAgentQL 是一套用于将 AI 连接到网页的工具集,核心是提供一种类似 SQL 的查询语言,让开发者能通过自然语言描述网页元素或数据,再结合 Playwri★ 1,471chatgpt-scraper-apichatgpt-scraper-api 是一个基于 ChatGPT 的智能抓取 API 工具,它允许开发者通过简单的 API 调用,利用 ChatGPT 的语义★ 1,057ketchketch 是一个用 Go 编写的快速、无状态的命令行工具,专为 AI 代理设计,用于网页搜索和抓取。它解决了 AI 代理在获取实时网络信息时面临的效率低、状态★ 675browser-searchbrowser-search 是一个为 AI 智能体设计的开源技能包,旨在让 AI 具备真实、可靠的联网搜索与浏览能力。它通过集成 SearXNG 元搜索引擎实★ 527llm-readerllm-reader 是一个将网页转换为大语言模型友好文本输入的开源工具,定位类似 Firecrawl 和 Jina Reader API。它主要解决 RAG(★ 311MinerU-HTMLMinerU-HTML 是一个基于小型语言模型(SLM)的 HTML 主内容提取工具,能够从杂乱网页中提取干净的 HTML 正文。它解决的是网页内容解析中常见的★ 293playwright这是 Playwright 的 PHP 客户端库,让 PHP 开发者无需切换语言就能驱动真实浏览器完成自动化操作。它通过 JSON-RPC 与 Playwrig★ 247hh-ai-agenthh-ai-agent 是一个针对俄罗斯招聘平台 hh.ru 的 AI 求职助手,使用 Python 编写。它通过 Playwright 自动化浏览器操作,结合★ 240apify-sdk-pythonApify SDK for Python 是 Apify 官方推出的 Python 库,用于构建 Apify Actors——运行在 Apify 云平台上的无服★ 178clearcote-browserclearcote-browser 是一个开源的隐身 Chromium 浏览器,核心目标是在引擎层面伪造浏览器指纹,让自动化脚本和爬虫更难被网站识别与封禁。它基★ 168kogiqa-mcpkogiqa-mcp 是一个面向 AI Agent 的浏览器自动化 MCP 服务器,基于 JavaScript 开发,底层使用 Playwright 与无头 C★ 95AI_Manga_ReaderAI_Manga_Reader 是一款基于 MangaDex API 的下一代漫画阅读应用,旨在解决跨语言漫画阅读和听力辅助问题。它利用 AI 驱动的 OCR ★ 57