scraper

本站收录 25 个带「scraper」标签的 AI 开源项目

firecrawl面向 AI 时代的上下文 API,提供大规模网页搜索、抓取与交互能力,让开发者轻松把互联网数据接入智能体应用,是 RAG 和 AI 工作流的数据入口利器。★ 186,524crawl4aiCrawl4AI 是一个面向大语言模型的开源网页爬虫与抓取工具,用 Python 编写。它解决的核心问题是:传统爬虫抓下来的 HTML 噪声大、结构乱,直接喂给★ 84,413EasySpiderEasySpider 是一款可视化、无代码的网页爬虫与浏览器自动化工具,主要面向非程序员用户。它通过图形化界面让用户像搭积木一样设计爬虫任务,无需编写代码即可完★ 44,621invisible_playwright_mcpinvisible_playwright_mcp 是一个基于 Playwright 的 MCP(Model Context Protocol)服务器,核心卖点是★ 31,726Jobs_Applier_AI_Agent_AIHawkAIHawk 是一个开源的 AI 求职申请机器人,用 Python 编写,旨在自动化整个求职申请流程。它能够自动浏览招聘网站,针对每个职位生成定制化的简历和求职★ 31,708AIHawkAIHawk 最初是一个 AI 网页代理,用于批量投递职位,现正演变为通用型代理:你指定目标,它自动在网页上执行操作。项目用 Python 编写,核心能力包括浏★ 31,708crawleeCrawlee 是 Apify 开源的 Node.js 网页抓取与浏览器自动化库,用 JavaScript/TypeScript 编写,目标是让开发者快速构建稳★ 25,949maxunMaxun 是一个开源的零代码网页数据提取平台,专为需要快速从网站获取结构化数据的用户设计。它解决了传统爬虫开发门槛高、维护成本大的问题,让非技术人员也能通过可★ 17,595crawlee-pythonCrawlee 是 Apify 推出的 Python 网页抓取与浏览器自动化库,目标是让开发者用一套统一 API 构建稳定可靠的爬虫。它解决的核心问题是:传统爬★ 9,569llm-scraperllm-scraper 是一个基于 TypeScript 的开源库,利用大语言模型将任意网页转换为结构化数据。它解决了传统网页抓取工具依赖固定选择器、难以应对页★ 6,939myGPTReadermyGPTReader 是一个社区驱动的 AI 阅读与对话工具,利用 ChatGPT 技术帮助用户高效阅读和交互。它通过爬虫抓取网页内容,结合嵌入技术,让用户能★ 4,412CyberScraper-2077CyberScraper-2077 是一个由大语言模型驱动的开源网络爬虫工具,支持 OpenAI、Gemini 和 Ollama 等主流 LLM 后端。它解决了★ 3,269weibo_terminaterweibo_terminater 是一个基于 Python 的微博数据爬虫工具,旨在高效、全面地抓取微博平台上的公开数据,包括微博内容、评论、关注者列表等。它解★ 2,316DevDocsDevDocs 是一个完全免费、注重隐私的基于 UI 的技术文档 MCP 服务器,专为程序员和软件开发者设计。它解决了开发者在编码时频繁切换 IDE 和浏览器查★ 2,107x-tweet-fetcherx-tweet-fetcher 是一个无需登录或 API 密钥即可抓取 X/Twitter 推文、回复、时间线和文章的 Python 工具,专为 AI 智能体设★ 970cryptoCMDcryptoCMD 是一个 Python 库,用于获取和整理加密货币的历史价格数据,数据源为 CoinMarketCap。它解决了加密货币历史行情数据获取难、格★ 610readerReader 是一套面向 AI 应用的开源 Web 基础设施,主要解决大模型和智能体在获取网页内容时遇到的脏数据、反爬拦截和会话管理难题。它提供抓取、爬取和自动★ 560llm-readerllm-reader 是一个将网页转换为大语言模型友好文本输入的开源工具,定位类似 Firecrawl 和 Jina Reader API。它主要解决 RAG(★ 311readerreader 是 Jina AI Reader 的本地化改编版本,通过 Docker 实现一键部署,将任意网页 URL 转换为大语言模型友好的输入格式。它解决的★ 307flickr_scraperflickr_scraper 是一个基于 Python 的 Flickr 图片抓取工具,专门用于按关键词批量下载图片,快速构建计算机视觉数据集。它通过 Flic★ 301OpenAverOpenAver 是一款免费开源的桌面应用,专为 JAV(日本成人影视)媒体库管理而设计。它解决了 Jellyfin、Emby 和 Kodi 等媒体服务器中 J★ 287unofficial-claude-api这是一个非官方的 Claude API 封装库,基于 Python 实现,通过 Firefox 浏览器和 geckodriver 驱动,自动模拟登录 Claud★ 204BrowserPilotBrowserPilot 是一个开源的浏览器智能体项目,旨在替代 Perplexity Comet、director.ai 和 firecrawl 的组合功能。★ 180fitterfitter 是一个用 Go 编写的智能体工具,旨在提供一种从 API 和网站收集信息的新方式。它结合了 AI 代理、API 调用、网页抓取和数据解析能力,并支★ 133wxpathwxpath 是一个基于 XPath 的声明式网页爬取工具,它提出了一种称为 Web Query Language(WQL)的查询语言,让开发者可以用类似 SQ★ 110