crawlee-python

一套 API 搞定反爬、代理和动态页面,稳定抓数据喂给 AI。

Crawlee 是 Apify 推出的 Python 网页抓取与浏览器自动化库,目标是让开发者用一套统一 API 构建稳定可靠的爬虫。它解决的核心问题是:传统爬虫在真实网站上容易遇到反爬、动态渲染、代理失效、请求重试和并发调度混乱等麻烦,需要自己拼装 Playwright、BeautifulSoup、HTTP 客户端和队列系统。Crawlee 把这些能力整合起来,内置请求队列、自动重试、会话管理、代理轮换、并发控制和数据存储,并支持 Parsel、BeautifulSoup、Playwright 以及原始 HTTP 请求,可在有头与无头模式间切换。抓取结果可直接用于 AI、LLM、RAG 或 GPT 场景,也能下载 HTML、PDF、JPG、PNG 等文件。对需要长期维护、规模化运行的采集任务来说,它把工程细节封装成可配置项,降低从脚本到生产爬虫的门槛。

开源 freemium 自动化工作流
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 9535
维护状态 活跃
是否开源
定价模式 freemium

项目数据

分类自动化工作流
开发团队apify
所属国家
定价模式freemium
价格说明开源库免费,Apify云平台提供付费套餐
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型apify,automation,beautifulsoup,crawler,crawling,headless,headless-chrome,parsel,pip,playwright,python,scraper,scraping,selenium,web-crawler,web-crawling,web-scraping
GitHub 星标★ 9535
30天Star增速
HF 下载量
上线时间2024-01-10 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-18
浏览次数0

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

环境要求

  • Python 3.10 或更高版本(PyPI 徽章标注 python-3.10+)
  • 已安装 pip,可用 python -m pip 调用
  • 可访问 PyPI 与 Playwright 浏览器下载源的网络环境

安装与启动步骤

  1. 1安装 Crawlee 全功能

    官方推荐安装带 all 扩展的完整版,包含核心功能与可选特性,保持默认依赖最小化时可去掉 [all]。

    python -m pip install 'crawlee[all]'
  2. 2安装 Playwright 依赖

    使用浏览器自动化能力前必须执行,会下载 Playwright 所需的浏览器与系统依赖。

    playwright install
  3. 3验证安装

    导入 crawlee 并打印版本号,能正常输出版本即表示包安装成功。

    python -c 'import crawlee; print(crawlee.__version__)'
  4. 4可选:部署到 Apify

    README 说明 Crawlee 开源可随处运行,也可借助 Apify 平台在云端部署,具体做法见 Apify SDK 文档。

如何确认成功

执行 python -c 'import crawlee; print(crawlee.__version__)',能打印出版本号且无报错。

常见问题

Q:必须安装 crawlee[all] 吗?

A:不必。README 说明 crawlee 包本身包含核心功能,附加特性以可选 extras 形式提供,只为控制依赖体积时可只安装 crawlee。

Q:只装包不跑 playwright install 行吗?

A:README 明确要求在安装后执行 playwright install 安装 Playwright 依赖,否则浏览器自动化相关功能不可用。

Q:能部署到云上吗?

A:可以。Crawlee 是开源库,可在任何环境运行;官方也提供 Apify 平台方便地云端部署,详见 Apify SDK 文档。

Q:有更详细的安装说明吗?

A:README 指向官方文档的 Introduction 教程与 Setting up 页面(crawlee.dev/python/docs),可获取更细致的安装指导。

注意事项

  • README 仅给出安装与验证命令,未提供端口、配置文件或环境变量等参数信息。
  • 推荐先阅读官方 Introduction 教程再开始编写爬虫。
  • Crawlee 核心包与可选 extras 分离,按需安装可减小依赖体积。

核心亮点

  • 内置请求队列、自动重试、会话与代理轮换,减少自己造轮子的工程量
  • 同时支持 Playwright 无头/有头浏览器和 Parsel、BeautifulSoup、原生 HTTP,可按页面灵活选择抓取方式
  • 与 Apify 生态打通,抓取结果可直接导出用于 LLM、RAG 等 AI 数据管道

不足之处

  • Python 版相对 Node.js 版生态和示例仍偏少,部分高级功能跟进较慢
  • 深度绑定 Apify 平台概念,纯本地自托管时部分云能力需要额外适配

适用场景

  • 为 RAG 或大模型训练批量采集网页正文并清洗成结构化数据
  • 需要登录、翻页、动态渲染的电商或社交平台数据监控
  • 长期运行的竞品价格、舆情或招聘信息定时抓取任务

替代项目

Scrapy、Playwright、Selenium

项目介绍

crawlee-python 是一个自动化工作流领域的开源项目,官方简介:Crawlee—A web scraping and browser automation library for Python to build reliable crawlers. Extract data for AI, LLMs, RAG, or GPTs. Download HTML, PDF, JPG, PNG, and other files from websites. Works with Parsel, BeautifulSoup, Playwright, and raw HTTP. Both headful and headless mode. With proxy rotation.。项目使用 Python 开发,在 GitHub 上获得 9535 星标。

上一篇:moon

下一篇:FSB

同类项目推荐

n8n 开源

拖拽搭建自动化流程,轻松接入 AI 与 400+ 应用,搞定重复工作。

Fair-code workflow automation platform with native AI capabilities. Combine visual b···

★ 204578 2026-08-10
robotcode 开源

让 Robot Framework 拥有现代 IDE 体验,调试、补全、运行一气呵成。

Open Source Toolkit for Robot Framework, providing Language Server Protocol support,···

★ 299 2026-08-10
puppeteer 开源

用 JavaScript 轻松操控无头浏览器,搞定自动化测试与网页抓取。

JavaScript API for Chrome and Firefox

★ 95585 2026-08-10
customermates 开源

比 Pipedrive 直观 10 倍的现代开源 CRM,轻松管理客户与自动化流程。

Building a modern alternative to Pipedrive that is 10x more intuitive.

★ 227 2026-08-10