oxylabs-ai-studio-py

写几行代码,任意网站的数据自动送上门

Oxylabs AI Studio 的 Python SDK,通过 AI 驱动的抓取器、爬虫和浏览器自动化,从任意网站收集结构化数据。支持用自然语言指令完成抓取与爬取,为 LLM 智能体提供新鲜数据,是智能网页数据采集的一站式工具。

开源 unknown 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3395
维护状态 维护中
是否开源 是
定价模式 unknown

项目数据

分类搜索知识
开发团队oxylabs
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型ai-crawler,ai-grounding,ai-scraper,ai-scraping,ai-search,ai-tools,ai-training,ai-web-scraper,firecrawl-alternative,proxy-scraper,python-ai,search-api,tavily-alternative,web-scraping,web-scraping-ai,web-scraping-api,web-scraping-python,web-search-api
GitHub 星标★ 3395
30天Star增速
HF 下载量
上线时间2025-06-17 00:00:00
最近更新2026-09-22 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

环境要求

  • Python 3.10 或更高版本
  • Oxylabs AI Studio API Key(从 aistudio.oxylabs.io 获取)
  • 可访问外网以调用 Oxylabs API

安装与启动步骤

  1. 1安装 SDK

    使用 pip 从 PyPI 安装 oxylabs-ai-studio 包,建议在虚拟环境中执行以避免污染全局环境。

    pip install oxylabs-ai-studio
  2. 2准备 API Key

    登录 aistudio.oxylabs.io 控制台创建并复制 API Key,后续实例化客户端时传入。

  3. 3运行爬取示例

    创建 AiCrawler 实例,传入起始 URL 与自然语言指令,即可得到结构化结果。注意 output_format 为 json/csv/toon 时需提供 schema。

    python crawl_example.py
  4. 4运行浏览器智能体

    使用 BrowserAgent 让其自动操作网页,可先用 generate_schema 生成字段结构再执行 run。

    python browser_agent_example.py

关键配置

配置项必填说明示例
api_key是Oxylabs AI Studio 的访问密钥,实例化客户端时传入your-api-key-xxxxxxxx
url是爬取或浏览的起始网址https://oxylabs.io
user_prompt是指导数据提取的自然语言指令Find all pages with proxy products pricing
output_format否输出格式,默认 markdownmarkdown
schema否结构化提取的 JSON Schema,output_format 为 json/csv/toon 时必填{"type":"object"}
geo_location否代理地理位置,ISO2 代码或国家全称United States

如何确认成功

运行示例后终端打印出 Results 列表或 result.data,且无鉴权与网络报错,即表示调用成功。

常见问题

Q:没有 API Key 能运行吗?

A:不能,所有功能都需通过 API Key 鉴权,请先在 aistudio.oxylabs.io 注册并创建密钥。

Q:输出 JSON 报错缺少 schema 怎么办?

A:当 output_format 为 json、csv 或 toon 时必须传入 schema,可用 generate_schema 生成或自行定义。

Q:爬取不到 JavaScript 渲染的内容?

A:将 render_javascript 设为 True,让爬取器执行页面脚本后再提取数据。

Q:返回结果太少或太多?

A:调整 return_sources_limit 参数控制返回来源数量,默认值为 25。

注意事项

  • Python 版本需 3.10 及以上,低版本会安装失败。
  • 示例中的 是占位符,必须替换为真实密钥。
  • API 调用会消耗账户额度,调试时建议降低 return_sources_limit。
  • 涉及代理地理位置时请使用 ISO2 代码或国家规范名称(如 Germany)。

核心亮点

  • 提供自然语言驱动的AI爬虫与浏览器自动化,降低数据采集门槛
  • 集成代理支持,增强数据抓取的稳定性和匿名性
  • 作为Firecrawl的替代方案,具备差异化定位和活跃的社区关注

不足之处

  • 文档/社区待观察

适用场景

  • 为LLM代理提供实时结构化网页数据
  • 通过自然语言指令进行复杂网站的数据抓取与爬取
  • 需要代理支持的大规模数据采集场景

替代项目

Firecrawl、Scrapy、Apify

项目介绍

oxylabs-ai-studio-py 是自动化工作流领域的开源项目,由 oxylabs 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,395)位列前 30%,在自动化工作流分类中处于中上游。

近 42 天,它的 GitHub 星标从 3,298 增加到 3,395,净增 97。

项目仍在小幅维护中,最近一次代码更新于 2026-09-22。从国内网络环境看,可直接访问。

它主要面向的使用场景是:为LLM代理提供实时结构化网页数据。同类可对比的替代方案包括 Firecrawl、Scrapy、Apify。

上一篇:writing-agent

下一篇:ai-scraper-py

同类项目推荐

n8n 开源

拖拽搭建自动化流程,轻松接入 AI 与 400+ 应用,搞定重复工作。

Fair-code workflow automation platform with native AI capabilities. Combine visual b···

★ 205700 2026-08-10
feishu-docx 开源

让 AI 代理轻松读写飞书文档,双向转换 Markdown

Feishu/Lark Docs、Sheet、Bitable <-> Markdown | AI Agent-friendly knowledge base exp···

★ 262 2026-08-09
robotcode 开源

让 Robot Framework 拥有现代 IDE 体验,调试、补全、运行一气呵成。

Open Source Toolkit for Robot Framework, providing Language Server Protocol support,···

★ 301 2026-08-10
puppeteer 开源

用 JavaScript 轻松操控无头浏览器,搞定自动化测试与网页抓取。

JavaScript API for Chrome and Firefox

★ 95609 2026-08-10