data-extraction
本站收录 28 个带「data-extraction」标签的 AI 开源项目
firecrawl面向 AI 时代的上下文 API,提供大规模网页搜索、抓取与交互能力,让开发者轻松把互联网数据接入智能体应用,是 RAG 和 AI 工作流的数据入口利器。★ 186,524
crawl4aiCrawl4AI 是一个面向大语言模型的开源网页爬虫与抓取工具,用 Python 编写。它解决的核心问题是:传统爬虫抓下来的 HTML 噪声大、结构乱,直接喂给★ 84,413
Scrapegraph-ai基于 AI 的 Python 爬虫库,用自然语言描述需求即可智能解析网页、提取结构化数据,大幅降低传统爬虫的编写与维护成本。★ 31,419
stagehandStagehand 是一个基于 TypeScript 的浏览器自动化 SDK,把 Playwright 的底层控制能力与大模型驱动的自然语言指令结合起来,让开发★ 25,462
maxunMaxun 是一个开源的零代码网页数据提取平台,专为需要快速从网站获取结构化数据的用户设计。它解决了传统爬虫开发门槛高、维护成本大的问题,让非技术人员也能通过可★ 17,595
skillsskills 是一个专为 AI 智能体设计的浏览器自动化命令行工具。它主要解决 AI 智能体在访问网页时遭遇反爬虫拦截、无法完成复杂交互操作的问题。其核心能力包★ 6,040
ferretFerret 是一个声明式的数据自动化语言及 Go 运行时,旨在简化结构化数据提取工作流。它通过自定义 DSL 让用户以声明式方式描述从网页或文档中提取数据的逻★ 6,013
brightdata-mcpbrightdata-mcp 是一个基于 Model Context Protocol (MCP) 的服务器,为 AI 应用提供统一的公共网络访问能力。它解决了★ 2,662
HeadlessXHeadlessX 是一个基于 Camoufox(Firefox 内核)的自托管浏览器自动化平台,主打“零检测率”和隐私保护。它解决了传统无头浏览器(如 Pup★ 2,325
contextgemContextGem 是一个专注于从文档中提取结构化信息的 Python 库,旨在简化 LLM 在文档解析和信息抽取任务中的使用流程。它解决了传统 LLM 提取★ 2,005
crwcrw 是一个用 Rust 编写的轻量级网络爬虫、抓取与搜索 API,旨在作为 Firecrawl 和 Tavily 的高性能替代品。它解决了 AI 智能体在获★ 1,091
crwcrw 是一个用 Rust 编写的轻量级网页抓取、爬取与搜索 API,定位为 Firecrawl 和 Tavily 的开源替代品。它解决的是 AI 智能体获取实★ 1,091
pdf_oxidepdf_oxide 是一个用 Rust 编写的高性能 PDF 处理库,提供 Python 和 Rust 双语言接口。它解决了现有 PDF 库处理速度慢、内存占用★ 1,056
eclaireeclaire 是一个本地优先、开源的 AI 助手,旨在统一管理你的个人数据,包括任务、笔记、文档、照片和书签。它解决的是个人数据分散在多个应用、难以统一检索和★ 922
hacker-news-digesthacker-news-digest 是一个用 Python 编写的工具,它通过调用 ChatGPT API 自动抓取 Hacker News 上的热门内容,并★ 755
readerReader 是一套面向 AI 应用的开源 Web 基础设施,主要解决大模型和智能体在获取网页内容时遇到的脏数据、反爬拦截和会话管理难题。它提供抓取、爬取和自动★ 560
web-scraper-apiOxylabs Web Scraper API 是一站式网页抓取接口,专为实时、大规模数据提取设计。单次请求即可完成代理、CAPTCHA 处理、JavaScri★ 494
teracrawlteracrawl 是一个专为大型语言模型(LLM)优化设计的高性能网页爬虫 API。它解决的核心问题是:LLM 应用需要从任意网站或搜索结果中提取干净、结构化★ 285
x-twitter-scraperx-twitter-scraper 是一个面向 X(原 Twitter)平台的数据采集与发布工具,以智能体技能包(Agent Skill)的形式提供。它解决了 ★ 211
oxidizePdfoxidizePdf 是一个用纯 Rust 编写的 PDF 处理库,专为 AI 和 RAG 场景设计。它解决了 PDF 在检索增强生成中文本提取结构混乱、分块不★ 192
apify-sdk-pythonApify SDK for Python 是 Apify 官方推出的 Python 库,用于构建 Apify Actors——运行在 Apify 云平台上的无服★ 178
AutomatiQAutomatiQ 是一个针对网页的 AI 助手逆向工程工具,用 Python 编写。它解决的核心问题是:当现有 AI 助手或自动化工具无法满足特定网页交互需求★ 168
pdfstractPDFStract 是一个专注于 RAG(检索增强生成)流程的 PDF 处理工具,提供从 PDF 中提取文本、智能分块(chunking)和向量化嵌入(embe★ 154
office_oxideoffice_oxide 是一个用 Rust 编写的高性能 Office 文档处理库,提供 Python、Rust、Go、JS/TS、C# 和 WASM 多语言★ 138
anansianansi 是一个面向恶意站点的自愈式爬虫工具,旨在解决传统爬虫在面对反爬机制时容易失效的问题。其核心能力包括:自动修复失效的 CSS 选择器,当静态解析失败★ 116
docwireDocWire SDK 是一个基于 C++20 的本地优先文档数据处理框架,主打确定性、可审计、可私有化部署的工作流。它解决的是企业或开发者在处理大量异构文档时★ 113
wxpathwxpath 是一个基于 XPath 的声明式网页爬取工具,它提出了一种称为 Web Query Language(WQL)的查询语言,让开发者可以用类似 SQ★ 110
tweetclawtweetclaw 是一个基于 OpenClaw 的插件,用于扩展智能体的 Twitter/X 操作能力。它解决了智能体无法直接与 Twitter 交互的问题,★ 95