llm-scraper

用大白话描述想要的数据,LLM 自动从网页提取结构化 JSON。

llm-scraper 是一个基于 TypeScript 的开源库,利用大语言模型将任意网页转换为结构化数据。它解决了传统网页抓取工具依赖固定选择器、难以应对页面结构变化的问题,通过自然语言描述所需数据,让 LLM 理解网页内容并提取出 JSON 格式的信息。核心能力包括:支持多种 LLM 提供商(如 OpenAI、Anthropic 等),提供简洁的 API 接口,内置流式处理和重试机制,并能与 Playwright 等浏览器自动化工具集成,实现动态页面抓取。它适用于数据采集、市场调研、内容聚合等场景,大幅降低网页数据提取的维护成本。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 6939
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队mishushakov
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言TypeScript
技术栈/模型ai,artificial-intelligence,browser,browser-automation,gpt,gpt-4,langchain,llama,llm,openai,playwright,puppeteer,scraper
GitHub 星标★ 6939
30天Star增速
HF 下载量
上线时间2024-04-20 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

环境要求

  • Node.js 与 npm 环境(需可执行 npm i)
  • 一个可用的 LLM 提供商账号及 API Key(如 OpenAI、Anthropic、Google、Groq 或本地 Ollama)
  • 项目需支持 ESM/TypeScript 模块导入(示例均为 import 语法)
  • Playwright 运行所需的浏览器环境(README 未给出安装命令,需自行准备)

安装与启动步骤

  1. 1安装核心依赖

    从 npm 安装 zod、playwright 与 llm-scraper 三个必需依赖,这是官方 Getting started 的第一步。

    npm i zod playwright llm-scraper
  2. 2安装提供商包

    按你选用的模型厂商安装对应 AI SDK 包;下面以 OpenAI 为例,其他厂商见配置说明。

    npm i @ai-sdk/openai
  3. 3初始化 LLM

    导入提供商并传入模型名创建 llm 对象,例如 OpenAI 的 gpt-4o,供后续抓取使用。

    import { openai } from '@ai-sdk/openai'
    
    const llm = openai('gpt-4o')
  4. 4创建抓取器实例

    导入 LLMScraper 并把上一步的 llm 传入构造函数,得到可用的 scraper 实例。

    import LLMScraper from 'llm-scraper'
    
    const scraper = new LLMScraper(llm)

关键配置

配置项必填说明示例
apiKey是调用大模型接口所需的密钥,示例中从环境变量读取process.env.GROQ_API_KEY
baseURL否自定义兼容 OpenAI 协议的服务地址,如 Groq、自建网关https://api.groq.com/openai/v1
model是传给提供商函数的模型名称,如 gpt-4o、claude-3-5-sonnet-20240620gpt-4o

如何确认成功

按上述步骤依次安装并执行脚本,若成功打印出 scraper 实例且无模块导入报错,即表示依赖与 LLM 初始化正常。

常见问题

Q:支持哪些大模型?

A:README 说明支持 GPT、Sonnet、Gemini、Llama、Qwen 系列,并给出了 OpenAI、Anthropic、Google、Groq、Ollama 五种初始化示例。

Q:必须安装全部提供商包吗?

A:不需要。只安装你要用的那一个,例如用 Anthropic 就装 @ai-sdk/anthropic,用 Ollama 就装 ollama-ai-provider-v2。

Q:怎么用本地 Ollama 模型?

A:安装 npm i ollama-ai-provider-v2,然后 import { ollama } 并调用 ollama('llama3') 得到 llm。

Q:Groq 怎么接入?

A:安装 @ai-sdk/openai,用 createOpenAI 指定 baseURL 为 https://api.groq.com/openai/v1 和 GROQ_API_KEY,模型填 llama3-8b-8192。

注意事项

  • 项目已更新到 2.0 版本,基于 Vercel AI SDK 6,旧版示例可能不兼容。
  • 数据 Schema 可用 Zod 或 JSON Schema 定义,支持 html、raw_html、markdown、text、image、custom 六种格式化模式。
  • 基于 Playwright 框架,动态页面抓取依赖浏览器运行时;README 未提供浏览器安装命令,需自行确认环境。
  • README 节选未包含完整抓取调用示例与验证命令,实际使用请以仓库最新文档为准。

核心亮点

  • 无需编写 CSS 选择器,用自然语言定义提取字段,上手极快
  • 支持流式输出和自动重试,处理大规模抓取更稳定
  • 与 Playwright 深度集成,轻松应对 JavaScript 渲染的页面

不足之处

  • 依赖 LLM API,每次抓取有 token 成本,不适合超大规模抓取
  • 提取准确性受模型能力影响,复杂页面可能需多次调优提示词

适用场景

  • 爬取电商商品信息(价格、评论)并结构化入库
  • 监控竞品官网更新,提取新闻或公告字段
  • 从招聘网站批量提取职位要求和薪资数据

替代项目

ScrapeGraphAI、Firecrawl、Spider

项目介绍

llm-scraper 是搜索知识领域的开源项目,由 mishushakov 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(6,939)位列前 7%,在搜索知识分类的 585 个项目里位列前 9%。

近 41 天,它的 GitHub 星标从 6,905 增加到 6,939,净增 34。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:爬取电商商品信息(价格、评论)并结构化入库。同类可对比的替代方案包括 ScrapeGraphAI、Firecrawl、Spider。

上一篇:search_with_lepton

下一篇:LLocalSearch

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
ragflow 开源

让大模型用上你的私有知识,搭建可靠的企业级RAG应用

RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···

★ 91170 2026-08-09