langchain-scrapingbee

让 LangChain 应用一键抓取反爬网页,直接喂给大模型

langchain-scrapingbee 是 ScrapingBee 官方维护的 LangChain 集成包,把 ScrapingBee 的网页抓取与代理渲染能力封装成 LangChain 可调用的工具和文档加载器。它解决的问题是:大模型应用做 RAG 或联网检索时,常遇到目标站点反爬、需要 JS 渲染、动态内容加载等情况,普通 requests 抓取拿不到正文。该包提供 ScrapingBeeLoader 等组件,可直接接入 LangChain 的链、Agent 和检索流程,自动处理代理轮换、浏览器渲染与反封锁,把抓取结果转成 LangChain Document 对象。开发者只需配置 API Key,即可在已有 LangChain 工作流中替换抓取环节,无需自己维护代理池和渲染服务。项目体量小、定位清晰,适合需要稳定网页数据源的 LLM 应用快速接入。

开源 free 开发框架
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 102
维护状态 维护中
是否开源
定价模式 free

项目数据

分类开发框架
开发团队ScrapingBee
所属国家
官网地址
定价模式free
价格说明开源免费,ScrapingBee 服务需另付费
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型
GitHub 星标★ 102
30天Star增速
HF 下载量
上线时间2025-08-07 00:00:00
最近更新2026-08-19 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-12
浏览次数1

使用教程

核心亮点

  • 官方维护,与 LangChain 的 Document/工具接口对齐,接入成本低
  • 复用 ScrapingBee 的代理池和 JS 渲染,抓取动态页面成功率高于裸 requests
  • 支持在 LangChain 链和 Agent 中作为标准组件调用,便于搭建 RAG 数据管道

不足之处

  • 强依赖 ScrapingBee 付费 API,无 Key 无法使用,免费额度有限
  • 功能相对单一,仅做抓取封装,缺少解析、清洗等后处理能力

适用场景

  • 为 RAG 知识库抓取需要 JS 渲染的电商或新闻页面
  • 在 LangChain Agent 中让模型自主联网检索并读取网页正文
  • 批量采集反爬严格的站点,作为 LLM 应用的数据入口

替代项目

langchain-community 内置的 WebBaseLoader、firecrawl-py

项目介绍

langchain-scrapingbee 是一个开发框架领域的开源项目,官方简介:LangChain integrations for ScrapingBee。项目使用 Python 开发,在 GitHub 上获得 102 星标。

上一篇:sagents

下一篇:engrim

同类项目推荐

langchain 开源

组装 AI 应用的乐高积木,从想法到上线不换工具

The agent engineering platform.

★ 146451 2026-08-09
transformers 开源

全球最大的模型仓库全家桶,想用的模型一把抓

Transformers: the model-definition framework for state-of-the-art machine learning m···

★ 166251 2026-08-09
bruno 开源

把 API 测试当代码管理,用 Git 搞定协作与版本追踪

Opensource IDE For Exploring and Testing API's (lightweight alternative to Postman/I···

★ 46994 2026-08-12