ai-scraping
本站收录 10 个带「ai-scraping」标签的 AI 开源项目
firecrawl面向 AI 时代的上下文 API,提供大规模网页搜索、抓取与交互能力,让开发者轻松把互联网数据接入智能体应用,是 RAG 和 AI 工作流的数据入口利器。★ 186,524
Scrapegraph-ai基于 AI 的 Python 爬虫库,用自然语言描述需求即可智能解析网页、提取结构化数据,大幅降低传统爬虫的编写与维护成本。★ 31,419
AnyCrawlAnyCrawl 是一个基于 Node.js/TypeScript 的开源爬虫工具,主要解决将网站内容转化为大语言模型(LLM)可用的结构化数据,以及从 Goo★ 3,464
oxylabs-ai-studio-pyOxylabs AI Studio 的 Python SDK,通过 AI 驱动的抓取器、爬虫和浏览器自动化,从任意网站收集结构化数据。支持用自然语言指令完成抓取★ 3,396
CyberScraper-2077CyberScraper-2077 是一个由大语言模型驱动的开源网络爬虫工具,支持 OpenAI、Gemini 和 Ollama 等主流 LLM 后端。它解决了★ 3,269
webclawwebclaw 是一个用 Rust 编写的本地优先网页内容提取工具,专为 LLM 设计。它解决的是大模型应用开发中网页数据获取难、格式杂乱的问题,能将网页高效转★ 2,366
ai-scraper-pyAI Scraper 是一款功能强大的抓取工具与抓取智能体,以无与伦比的精度自动化数据提取,适合跨多种网页来源的大规模 AI 抓取任务。它把复杂的抓取流程简化为★ 1,092
firecrawl-app-examplesFirecrawl 是一个将网站内容转换为 LLM 可读格式的爬虫服务,本仓库则收录了基于 Firecrawl 构建的完整应用示例,包括网站和其他项目。它解决了★ 826
oxylabs-ai-studio-jsOxylabs AI Studio 的 JavaScript SDK,通过 AI 驱动的抓取器、爬虫与浏览器自动化,从任意网站收集结构化数据。支持自然语言指令完★ 411
teracrawlteracrawl 是一个专为大型语言模型(LLM)优化设计的高性能网页爬虫 API。它解决的核心问题是:LLM 应用需要从任意网站或搜索结果中提取干净、结构化★ 285