PyScrappy

给 AI 智能体一个干净的结构化网页数据接口

PyScrappy 是一个 Python 编写的网页抓取工具包,同时提供 MCP 服务器,让 AI 智能体能够从任意 URL 或内置抓取器中获取干净、结构化的网页数据。它解决了 AI 应用在获取网页数据时面临的格式杂乱、解析困难、缺乏统一接口等问题。核心能力包括:支持任意 URL 的通用抓取,内置电商、食品、图片、新闻等特定领域的抓取器,输出结构化数据,并通过 MCP 协议与 AI 智能体无缝集成。项目处于早期阶段,但已具备基础抓取和 MCP 服务能力,适合需要快速为 AI 应用接入网页数据源的开发者。

开源 unknown 智能体
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 256
维护状态 活跃
是否开源
定价模式 unknown

项目数据

分类智能体
开发团队mldsveda
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型ai,ai-agents,ecommerce-scrapper,food-scrapper,hacktoberfest,hacktoberfest-accepted,image-scrapper,mcp,mcp-server,news-scrapper,pyscrappy,python,social-media-scrapper,song-scrapper,stock-scrapper,web-scrapping,wikipedia-scrapper
GitHub 星标★ 256
30天Star增速
HF 下载量
上线时间2021-06-21 00:00:00
最近更新2026-09-21 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 内置电商、食品、图片、新闻等专用抓取器,开箱即用
  • 通过 MCP 协议与 AI 智能体集成,降低数据获取门槛
  • 支持任意 URL 通用抓取,灵活应对长尾需求

不足之处

  • 项目处于早期,文档和社区生态待观察
  • 内置抓取器覆盖领域有限,扩展需自行开发

适用场景

  • AI 智能体需要实时获取商品价格或库存信息
  • 构建新闻聚合或舆情分析工具时抓取新闻网站
  • 为 AI 应用提供统一的网页数据接入层

替代项目

Scrapy、BeautifulSoup、Firecrawl

项目介绍

PyScrappy 是智能体领域的开源项目,由 mldsveda 开发,2021 年首次发布。

它收录于智能体分类,该分类目前共有 2,499 个项目,GitHub 星标数为 256。

近 43 天,它的 GitHub 星标从 106 增加到 256,净增 150。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-21。从国内网络环境看,当前已无法正常访问。

它主要面向的使用场景是:AI智能体需要实时获取商品价格或库存信息。同类可对比的替代方案包括 Scrapy、BeautifulSoup、Firecrawl。

上一篇:ai-devkit

下一篇:roam-code

同类项目推荐

xinchao-dynamic-mind 开源

给 AI 装上疲惫和欲望,让交互更真实

独立、可自托管的 AI 动态心智状态引擎:驱动力、念头池、疲惫、睡眠与意图。

★ 195 2026-08-09
deepseek-harness 开源

把 AI 能力拆成乐高积木,拼出你的专属智能体。

DeepSeek Harness: Everything is a Plugin.

★ 233327 2026-08-15
AutoGPT 开源

开箱即用的 AI 员工,交代任务就自己干完

AutoGPT is the vision of accessible AI for everyone, to use and to build on. Our mis···

★ 187492 2026-08-09
EvoAgentX 开源

让 AI 智能体自己迭代变强,越用越聪明

EvoAgentX: Building a Self-Evolving Ecosystem of AI Agents

★ 3351 2026-09-12