extractor 是搜索知识领域的开源项目,由 lightfeed 开发,2025 年首次发布。
它收录于搜索知识分类,该分类目前共有 586 个项目,GitHub 星标数为 321。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-24。Apache-2.0 许可证,可免费使用和部署。
它主要面向的使用场景是:从电商页面提取商品价格、评论等结构化信息。同类可对比的替代方案包括 Scrapy、Cheerio、Firecrawl。

用自然语言描述,让 LLM 帮你从网页中提取结构化数据
extractor 是一个基于 TypeScript 的开源工具,利用大语言模型(LLM)从网页中稳健地提取结构化数据。它解决了传统网页爬虫依赖固定选择器、易受页面结构变化影响、难以处理复杂或动态内容的问题。核心能力包括:通过自然语言描述或示例定义提取目标,LLM 自动理解页面语义并抽取所需字段;支持多种数据格式输出(如 JSON);内置重试和错误处理机制,提高提取成功率;提供简洁的 API 和命令行界面,方便集成到现有工作流。项目处于早期阶段,但思路新颖,适合需要灵活、低维护成本网页数据提取的场景。
Scrapy、Cheerio、Firecrawl
extractor 是搜索知识领域的开源项目,由 lightfeed 开发,2025 年首次发布。
它收录于搜索知识分类,该分类目前共有 586 个项目,GitHub 星标数为 321。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-24。Apache-2.0 许可证,可免费使用和部署。
它主要面向的使用场景是:从电商页面提取商品价格、评论等结构化信息。同类可对比的替代方案包括 Scrapy、Cheerio、Firecrawl。
firecrawl
开源
网页抓取像喝水一样简单,开发者省下整周加班
The web data API to search, scrape, and interact at scale.
contoso-chat
开源
一键跑通 Azure RAG 应用,从代码到评估部署全流程
This sample has the full End2End process of creating RAG application with Prompty an···
graphify
开源
整个代码库画成一张图,找问题一眼定位
Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···
qiaomu-youtube-ai-podcast
开源
一站式索引AI播客,快速找到有文字稿和总结的节目
AI 播客索引:整理 AI 播客、中文简介、Transcript 状态和总结入口 | Curated AI podcast ···