open-extract

一句话让 AI 从文档和网页中提取结构化数据,直接返回 JSON。

open-extract 是一个面向 AI 代理的结构化数据提取工具,旨在让代理通过一次工具调用,从文档或网页中搜索特定数据,并以 JSON 或 Markdown 格式返回结果。它解决了 AI 代理在需要从非结构化文本中抽取字段时,往往需要编写复杂解析逻辑或多次调用模型的问题。核心能力包括:支持多种数据源(本地文档、网页)、基于自然语言查询提取、输出结构化格式、与代理框架无缝集成。项目处于早期阶段,代码库简洁,易于定制和扩展,适合开发者快速集成到自己的 AI 工作流中。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 189
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队velocitybolt
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型agent-tools,ai,autogen,context-aware,context-aware-structured-outputs,crewai,etl,etl-automation,etl-framework,langchain,langgraph,llm,openai,python,rag,structured-outputs,unstructured-data
GitHub 星标★ 189
30天Star增速
HF 下载量
上线时间2024-07-11 00:00:00
最近更新2026-08-15 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

核心亮点

  • 单次工具调用即可完成搜索与提取,显著降低代理的调用复杂度和延迟
  • 输出格式标准化为 JSON 或 Markdown,方便下游程序直接消费
  • 支持本地文档和网页多种数据源,适用场景广泛

不足之处

  • 项目处于早期阶段(188 星),API 和功能可能不够稳定
  • 文档和社区生态尚不完善,遇到问题可参考资源有限

适用场景

  • AI 代理需要从公司内部文档中提取关键字段(如合同编号、日期)
  • 从多个网页抓取商品价格、评论等结构化信息用于分析
  • 构建 RAG 系统时,将非结构化文档转换为结构化知识库

替代项目

Unstructured.io、LangChain 的输出解析器、Firecrawl

项目介绍

open-extract 是搜索知识领域的开源项目,由 velocitybolt 开发,2024 年首次发布。

它收录于搜索知识分类,该分类目前共有 581 个项目,GitHub 星标数为 189。

项目仍在小幅维护中,最近一次代码更新于 2026-08-15。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:AI代理需要从公司内部文档中提取关键字段(如合同编号、日期)。同类可对比的替代方案包括 Unstructured.io、LangChain 的输出解析器、Firecrawl。

上一篇:RAG-SaaS

下一篇:graphrag-practice-chinese

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
ragflow 开源

让大模型用上你的私有知识,搭建可靠的企业级RAG应用

RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···

★ 91170 2026-08-09