web-crawler

本站收录 17 个带「web-crawler」标签的 AI 开源项目

firecrawl面向 AI 时代的上下文 API,提供大规模网页搜索、抓取与交互能力,让开发者轻松把互联网数据接入智能体应用,是 RAG 和 AI 工作流的数据入口利器。★ 186,524crawl4aiCrawl4AI 是一个面向大语言模型的开源网页爬虫与抓取工具,用 Python 编写。它解决的核心问题是:传统爬虫抓下来的 HTML 噪声大、结构乱,直接喂给★ 84,413Scrapegraph-ai基于 AI 的 Python 爬虫库,用自然语言描述需求即可智能解析网页、提取结构化数据,大幅降低传统爬虫的编写与维护成本。★ 31,419crawleeCrawlee 是 Apify 开源的 Node.js 网页抓取与浏览器自动化库,用 JavaScript/TypeScript 编写,目标是让开发者快速构建稳★ 25,949crawlee-pythonCrawlee 是 Apify 推出的 Python 网页抓取与浏览器自动化库,目标是让开发者用一套统一 API 构建稳定可靠的爬虫。它解决的核心问题是:传统爬★ 9,569wigolowigolo 是一个面向 AI 编程代理的本地优先搜索与检索工具,通过 MCP 协议为 Claude 等智能体提供网络搜索、网页抓取、爬虫和研究能力。它解决了 ★ 5,427spiderspider 是一个用 Rust 编写的开源网络爬虫引擎,专为 AI 智能体和大型语言模型设计,用于高效获取网页数据。它解决了传统爬虫在数据提取、并发处理和反爬★ 2,747molimoli 是一个专为 AI 智能体设计的无头浏览器,使用 Rust 语言开发,主打轻量、快速和高兼容性。它解决了 AI 代理在网页自动化任务中面临的速度慢、资源★ 2,658webclawwebclaw 是一个用 Rust 编写的本地优先网页内容提取工具,专为 LLM 设计。它解决的是大模型应用开发中网页数据获取难、格式杂乱的问题,能将网页高效转★ 2,366crwcrw 是一个用 Rust 编写的轻量级网络爬虫、抓取与搜索 API,旨在作为 Firecrawl 和 Tavily 的高性能替代品。它解决了 AI 智能体在获★ 1,091crwcrw 是一个用 Rust 编写的轻量级网页抓取、爬取与搜索 API,定位为 Firecrawl 和 Tavily 的开源替代品。它解决的是 AI 智能体获取实★ 1,091firecrawl-app-examplesFirecrawl 是一个将网站内容转换为 LLM 可读格式的爬虫服务,本仓库则收录了基于 Firecrawl 构建的完整应用示例,包括网站和其他项目。它解决了★ 826Craw4LLMCraw4LLM 是一个面向大语言模型预训练的高效网页爬取工具,源自同名学术论文。它解决的是传统爬虫抓取网页时内容冗余、噪声大、与训练目标不匹配的问题,通过将爬★ 665readerReader 是一套面向 AI 应用的开源 Web 基础设施,主要解决大模型和智能体在获取网页内容时遇到的脏数据、反爬拦截和会话管理难题。它提供抓取、爬取和自动★ 560kochatkochat 是一个开源的韩语聊天机器人框架,基于 Python 构建,专注于韩语自然语言处理任务。它解决了韩语对话系统中缺乏专用工具的问题,提供了从语料抓取、★ 461web-scout-mcpweb-scout-mcp 是一个基于 JavaScript 的 MCP(模型上下文协议)服务器,为 AI 助手提供网页搜索和内容提取能力。它集成了 DuckD★ 134basemindbasemind 是一个为编码智能体提供统一上下文与内容层的 MCP 服务器,用纯 Rust 实现。它解决了 AI 编程工具在理解代码库、检索文档、共享记忆和协★ 102