CyberScraper-2077

用大白话指挥 AI 爬网页,不用写解析规则,要啥直接说。

CyberScraper-2077 是一个由大语言模型驱动的开源网络爬虫工具,支持 OpenAI、Gemini 和 Ollama 等主流 LLM 后端。它解决了传统爬虫需要手动编写解析规则、难以应对动态网页和反爬机制的问题,通过自然语言指令即可智能提取网页内容。核心能力包括:基于 LLM 的智能内容解析、多模型灵活切换、支持 JavaScript 渲染页面抓取、以及简单的命令行交互界面。用户无需精通正则表达式或 XPath,只需用自然语言描述需求,即可获得结构化数据。项目采用 Python 编写,安装便捷,适合快速原型开发和小规模数据采集。其赛博朋克风格的主题界面也颇具特色,为开发者提供了更友好的使用体验。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3265
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队itsOwen
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型ai-scraping,gemini-api,llm,llm-scraper,openai,scraper,web-scraper,webscraping
GitHub 星标★ 3265
30天Star增速
HF 下载量
上线时间2024-08-17 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 15 分钟 部署方式:本地安装 7 步

环境要求

  • Python 3.10 或更高版本
  • 可用的 pip 与 virtualenv(或 venv)
  • 至少一个 LLM 后端密钥:OpenAI 或 Google Gemini(Ollama 可选)
  • 如需 Docker 部署,需本机已安装 Docker
  • 首次运行需执行 playwright install 安装浏览器内核

安装与启动步骤

  1. 1克隆仓库

    从 GitHub 拉取项目源码并进入项目目录。

    git clone https://github.com/itsOwen/CyberScraper-2077.git
    cd CyberScraper-2077
  2. 2创建虚拟环境

    用 virtualenv 创建 venv 并激活,避免污染系统 Python 环境。

    virtualenv venv
    source venv/bin/activate
  3. 3安装依赖包

    按 requirements.txt 安装项目所需的全部 Python 依赖。

    pip install -r requirements.txt
  4. 4安装 Playwright

    安装 Playwright 浏览器内核,用于抓取 JavaScript 渲染页面。

    playwright install
  5. 5配置 API 密钥

    在 Linux/Mac 终端导出 OpenAI 与 Gemini 密钥,替换成自己的真实 key。

    export OPENAI_API_KEY="sk-xxxxxxxx"
    export GOOGLE_API_KEY="your-api-key-here"
  6. 6启动应用

    激活虚拟环境后运行 Streamlit 主程序,启动本地 Web 界面。

    source venv/bin/activate
    streamlit run main.py
  7. 7Docker 方式部署

    可选方案:构建镜像并运行容器,通过环境变量传入 API 密钥。

    docker build -t cyberscraper-2077 .
    docker run -p 8501:8501 -e OPENAI_API_KEY="sk-xxxxxxxx" -e GOOGLE_API_KEY="your-api-key-here" cyberscraper-2077

关键配置

配置项必填说明示例
OPENAI_API_KEY是OpenAI 后端使用的 API 密钥,本地与 Docker 均可通过环境变量传入。sk-xxxxxxxx
GOOGLE_API_KEY是Google Gemini 后端使用的 API 密钥。your-api-key-here
OLLAMA_BASE_URL否使用 Ollama 时的服务地址,Docker 下指向宿主机 11434 端口。http://host.docker.internal:11434
client_secret.json否Google Sheets 导出的 OAuth 客户端配置文件,重命名后使用。client_secret.json
tor_config.socks_port否Tor SOCKS 代理端口,用于自定义 Tor 抓取行为。9050
tor_config.circuit_timeout否Tor 电路创建的超时时间(秒)。10

如何确认成功

浏览器打开 http://localhost:8501,能看到 Streamlit 的赛博朋克界面即启动成功;Docker 方式同理。

常见问题

Q:Docker 里用 Ollama 连接失败怎么办?

A:先在宿主机执行 ollama pull llama3.1 并启动 Ollama,再设置 OLLAMA_BASE_URL。Linux 上可能需要把地址替换为宿主机 IP,并确认防火墙放行 11434 端口。

Q:如何抓取多页数据?

A:在输入 URL 时按 README 格式附加页码范围,如 https://example.com/p/ 1-5,7,9-12;也可用 {page} 占位符指定 URL 模式,建议每次都明确写出 URL 结构。

Q:报错提示 Python 版本不兼容?

A:项目要求 Python 3.10 或更高版本,请升级本机 Python 后重建虚拟环境并重新安装依赖。

Q:导入数据到 Google Sheets 时授权失败?

A:需在 Google Cloud Console 创建 OAuth 客户端,把 http://localhost:8501 等地址加入授权来源与重定向 URI,并将下载的配置重命名为 client_secret.json。

注意事项

  • 项目要求 Python 3.10 或更高版本。
  • 首次安装必须执行 playwright install,否则无法抓取 JS 渲染页面。
  • Windows 下激活虚拟环境的命令不同,README 仅给出 source venv/bin/activate。
  • 使用 Tor 时 Docker 需加 --network="host" 并开放对应端口。

核心亮点

  • 自然语言指令即可抓取,无需编写正则或 XPath,上手门槛极低
  • 支持 OpenAI、Gemini、Ollama 多模型切换,可本地部署保护隐私
  • 内置 JavaScript 渲染引擎,能处理动态网页内容,比传统爬虫更省心

不足之处

  • 依赖 LLM API,长期使用可能产生较高成本,且响应速度受网络影响
  • 文档/社区待观察

适用场景

  • 快速抓取新闻文章或博客内容,用于舆情分析或内容聚合
  • 从电商页面提取商品信息,如价格、评论,用于市场调研
  • 自动化收集研究数据,如论文摘要或学术信息,辅助文献综述

替代项目

Scrapy、Beautiful Soup、Playwright

项目介绍

CyberScraper-2077 是自动化工作流领域的开源项目,由 itsOwen 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,265)位列前 30%,在自动化工作流分类中处于中上游。

近 42 天,它的 GitHub 星标从 3,173 增加到 3,265,净增 92。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:快速抓取新闻文章或博客内容,用于舆情分析或内容聚合。同类可对比的替代方案包括 Scrapy、Beautiful Soup、Playwright。

上一篇:tracecat

下一篇:browser-control

同类项目推荐

n8n 开源

拖拽搭建自动化流程,轻松接入 AI 与 400+ 应用,搞定重复工作。

Fair-code workflow automation platform with native AI capabilities. Combine visual b···

★ 205700 2026-08-10
feishu-docx 开源

让 AI 代理轻松读写飞书文档,双向转换 Markdown

Feishu/Lark Docs、Sheet、Bitable <-> Markdown | AI Agent-friendly knowledge base exp···

★ 262 2026-08-09
robotcode 开源

让 Robot Framework 拥有现代 IDE 体验,调试、补全、运行一气呵成。

Open Source Toolkit for Robot Framework, providing Language Server Protocol support,···

★ 301 2026-08-10
puppeteer 开源

用 JavaScript 轻松操控无头浏览器,搞定自动化测试与网页抓取。

JavaScript API for Chrome and Firefox

★ 95609 2026-08-10