crawler
本站收录 28 个带「crawler」标签的 AI 开源项目
firecrawl面向 AI 时代的上下文 API,提供大规模网页搜索、抓取与交互能力,让开发者轻松把互联网数据接入智能体应用,是 RAG 和 AI 工作流的数据入口利器。★ 186,524
crawl4aiCrawl4AI 是一个面向大语言模型的开源网页爬虫与抓取工具,用 Python 编写。它解决的核心问题是:传统爬虫抓下来的 HTML 噪声大、结构乱,直接喂给★ 84,413
EasySpiderEasySpider 是一款可视化、无代码的网页爬虫与浏览器自动化工具,主要面向非程序员用户。它通过图形化界面让用户像搭积木一样设计爬虫任务,无需编写代码即可完★ 44,621
invisible_playwright_mcpinvisible_playwright_mcp 是一个基于 Playwright 的 MCP(Model Context Protocol)服务器,核心卖点是★ 31,726
Jobs_Applier_AI_Agent_AIHawkAIHawk 是一个开源的 AI 求职申请机器人,用 Python 编写,旨在自动化整个求职申请流程。它能够自动浏览招聘网站,针对每个职位生成定制化的简历和求职★ 31,708
AIHawkAIHawk 最初是一个 AI 网页代理,用于批量投递职位,现正演变为通用型代理:你指定目标,它自动在网页上执行操作。项目用 Python 编写,核心能力包括浏★ 31,708
Scrapegraph-ai基于 AI 的 Python 爬虫库,用自然语言描述需求即可智能解析网页、提取结构化数据,大幅降低传统爬虫的编写与维护成本。★ 31,419
crawleeCrawlee 是 Apify 开源的 Node.js 网页抓取与浏览器自动化库,用 JavaScript/TypeScript 编写,目标是让开发者快速构建稳★ 25,949
maxunMaxun 是一个开源的零代码网页数据提取平台,专为需要快速从网站获取结构化数据的用户设计。它解决了传统爬虫开发门槛高、维护成本大的问题,让非技术人员也能通过可★ 17,595
crawlee-pythonCrawlee 是 Apify 推出的 Python 网页抓取与浏览器自动化库,目标是让开发者用一套统一 API 构建稳定可靠的爬虫。它解决的核心问题是:传统爬★ 9,569
xiaobeixiaobei 是一个专为 OPC(One-Person Company,一人公司)及中小微企业设计的自媒体获客智能体。它通过多智能体协作、爬虫技术和 RPA ★ 8,574
trafilaturaTrafilatura 是一个用 Python 编写的网页文本与元数据抓取工具,同时提供命令行接口。它解决的核心问题是:从杂乱无章的 HTML 页面中精准提取正★ 6,890
myGPTReadermyGPTReader 是一个社区驱动的 AI 阅读与对话工具,利用 ChatGPT 技术帮助用户高效阅读和交互。它通过爬虫抓取网页内容,结合嵌入技术,让用户能★ 4,412
spiderspider 是一个用 Rust 编写的开源网络爬虫引擎,专为 AI 智能体和大型语言模型设计,用于高效获取网页数据。它解决了传统爬虫在数据提取、并发处理和反爬★ 2,747
fessFess 是一款基于 OpenSearch 构建的开源企业级搜索服务器,支持自托管,可爬取网页、文件、数据库与云端数据源,支持 20 多种语言,提供 REST ★ 1,138
crwcrw 是一个用 Rust 编写的轻量级网络爬虫、抓取与搜索 API,旨在作为 Firecrawl 和 Tavily 的高性能替代品。它解决了 AI 智能体在获★ 1,091
crwcrw 是一个用 Rust 编写的轻量级网页抓取、爬取与搜索 API,定位为 Firecrawl 和 Tavily 的开源替代品。它解决的是 AI 智能体获取实★ 1,091
chatWebchatWeb 是一个基于 Python 的开源对话助手,能够抓取网页、读取 PDF、DOCX、TXT 等文档,提取主要内容后,结合 OpenAI GPT 模型★ 917
hacker-news-digesthacker-news-digest 是一个用 Python 编写的工具,它通过调用 ChatGPT API 自动抓取 Hacker News 上的热门内容,并★ 755
Craw4LLMCraw4LLM 是一个面向大语言模型预训练的高效网页爬取工具,源自同名学术论文。它解决的是传统爬虫抓取网页时内容冗余、噪声大、与训练目标不匹配的问题,通过将爬★ 665
readerReader 是一套面向 AI 应用的开源 Web 基础设施,主要解决大模型和智能体在获取网页内容时遇到的脏数据、反爬拦截和会话管理难题。它提供抓取、爬取和自动★ 560
extractorextractor 是一个基于 TypeScript 的开源工具,利用大语言模型(LLM)从网页中稳健地提取结构化数据。它解决了传统网页爬虫依赖固定选择器、易受★ 321
ptt-alertorptt-alertor 是一个用 Go 编写的 PTT 文章实时通知机器人,支持 Telegram、LINE 和 Messenger 三大主流聊天平台。它解决了★ 264
FindJobs-AgentFindJobs-Agent 是一个基于大语言模型的开源智能体工具包,旨在自动化求职全流程。它围绕技能分析、AI模拟面试、简历评分和职位结构化四大核心功能展开,★ 244
CrawlAI-RAGCrawlAI-RAG 是一个基于 Python 的 AI 网站智能平台,核心功能是将整个网站抓取、索引,并利用检索增强生成(RAG)技术,让用户通过自然语言提★ 157
anansianansi 是一个面向恶意站点的自愈式爬虫工具,旨在解决传统爬虫在面对反爬机制时容易失效的问题。其核心能力包括:自动修复失效的 CSS 选择器,当静态解析失败★ 116
wxpathwxpath 是一个基于 XPath 的声明式网页爬取工具,它提出了一种称为 Web Query Language(WQL)的查询语言,让开发者可以用类似 SQ★ 110