extractor

用自然语言描述,让 LLM 帮你从网页中提取结构化数据

extractor 是一个基于 TypeScript 的开源工具,利用大语言模型(LLM)从网页中稳健地提取结构化数据。它解决了传统网页爬虫依赖固定选择器、易受页面结构变化影响、难以处理复杂或动态内容的问题。核心能力包括:通过自然语言描述或示例定义提取目标,LLM 自动理解页面语义并抽取所需字段;支持多种数据格式输出(如 JSON);内置重试和错误处理机制,提高提取成功率;提供简洁的 API 和命令行界面,方便集成到现有工作流。项目处于早期阶段,但思路新颖,适合需要灵活、低维护成本网页数据提取的场景。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 321
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队lightfeed
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言TypeScript
技术栈/模型ai-agents,article-extractor,crawler,data-engineering,data-pipeline,ecommerce-scraping,etl,google-gemini,html-parser,html-to-markdown,llm,llm-extraction,llm-scraper,markdown,nlp,openai,rag,web-data-extraction,web-extraction,webscraping
GitHub 星标★ 321
30天Star增速
HF 下载量
上线时间2025-05-02 00:00:00
最近更新2026-09-24 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

核心亮点

  • 基于 LLM 语义理解,无需维护脆弱的选择器,抗页面结构变化能力强
  • 支持通过自然语言或示例定义提取规则,上手门槛低
  • 提供 API 和 CLI,易于集成到自动化流程

不足之处

  • 依赖 LLM API,可能产生调用成本且速度较慢
  • 文档/社区待观察

适用场景

  • 从电商页面提取商品价格、评论等结构化信息
  • 监控新闻网站并抽取标题、正文、发布时间
  • 将非结构化网页内容转换为 JSON 供下游系统使用

替代项目

Scrapy、Cheerio、Firecrawl

项目介绍

extractor 是搜索知识领域的开源项目,由 lightfeed 开发,2025 年首次发布。

它收录于搜索知识分类,该分类目前共有 586 个项目,GitHub 星标数为 321。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-24。Apache-2.0 许可证,可免费使用和部署。

它主要面向的使用场景是:从电商页面提取商品价格、评论等结构化信息。同类可对比的替代方案包括 Scrapy、Cheerio、Firecrawl。

上一篇:arcana

下一篇:Hyper-RAG

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
qiaomu-youtube-ai-podcast 开源

一站式索引AI播客,快速找到有文字稿和总结的节目

AI 播客索引:整理 AI 播客、中文简介、Transcript 状态和总结入口 | Curated AI podcast ···

★ 70 2026-08-09