ExtractThinker

像操作数据库一样,用 LLM 轻松提取文档数据

ExtractThinker 是一个面向大语言模型的文档智能处理库,采用 ORM 风格的设计,让开发者能以类似数据库操作的方式灵活编排文档工作流。它解决了从复杂文档(如合同、发票、表格)中高效提取结构化数据的难题,通过声明式定义提取模式,自动处理文档分割、多模型调度、异步任务和结果校验。核心能力包括:支持多种后端(如 Tesseract、Azure AI Document Intelligence)、可插拔的 LLM 适配器、基于 Pydantic 的强类型输出、以及内置的文档生命周期管理。项目旨在降低构建文档 AI 应用的门槛,让开发者专注于业务逻辑而非底层集成细节。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1598
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队enoch3712
所属国家
定价模式free
价格说明开源库,Apache-2.0 许可,完全免费,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型ai,document-image-analysis,document-intelligence,document-parsing,document-processing,langchain,llm,machine-learning,nlp,ocr,openai,pdf,pdf-to-text,python
GitHub 星标★ 1598
30天Star增速
HF 下载量
上线时间2024-02-01 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

环境要求

  • 已安装 Python 环境(README 未写明最低版本要求)
  • 可用的 pip 包管理器与网络连接(用于从 PyPI 安装)
  • 至少一个 LLM 提供商的 API 凭证(README 提到 OpenAI、Anthropic、Cohere 等)
  • 可选:文档加载后端如 Tesseract OCR、Azure Form Recognizer、AWS Textract、Google Document AI 所

安装与启动步骤

  1. 1确认 Python 环境

    先确认本机已安装 Python 与 pip,并能正常联网。README 未指定 Python 最低版本,若版本过旧建议升级后再安装。

    python --version
  2. 2安装 ExtractThinker

    使用 pip 从 PyPI 安装官方包名 extract_thinker。README 只给出这一条安装命令,建议在虚拟环境中执行。

    pip install extract_thinker
  3. 3准备 LLM 凭证

    按所选提供商准备 API Key,供适配器调用。README 未给出具体环境变量名,需参考官网文档自行配置。

  4. 4准备文档加载后端

    根据需要选择 Tesseract OCR、Azure Form Recognizer、AWS Textract 或 Google Document AI。这些后端的安装与授权 README 未展开,需另行准备。

如何确认成功

README 未提供启动验证方式;可执行 pip show extract_thinker,若显示包名、版本等信息即表示安装成功。

常见问题

Q:安装时报找不到包怎么办?

A:确认包名拼写为 extract_thinker,并检查网络与 pip 源是否可用;必要时升级 pip 后重试。

Q:支持哪些 LLM 提供商?

A:README 提到可集成 OpenAI、Anthropic、Cohere 等提供商,通过可插拔的 LLM 适配器接入,具体用法见官网文档。

Q:支持哪些文档格式和加载器?

A:支持 PDF、图片、表格等多格式,加载器包括 Tesseract OCR、Azure Form Recognizer、AWS Textract、Google Document AI 等。

Q:如何定义要提取的字段?

A:用 Pydantic 模型定义自定义提取契约(Contract),即可获得强类型的结构化输出。

注意事项

  • 本项目是 Python 库/依赖,不是独立服务,无需单独部署服务器或暴露端口。
  • README 节选中 Usage 章节为空,具体调用方式与参数请以官网文档为准。
  • 使用 Azure、AWS、Google 等云端文档服务时,需自行准备相应账号、密钥与配额。
  • 大文档建议使用 README 提到的异步处理与拆分策略以提升效率。

核心亮点

  • ORM 式 API 设计,大幅简化文档提取流程的编排与复用
  • 支持多模态文档源(扫描件、PDF、图片),并集成 Tesseract 与云服务 OCR
  • 基于 Pydantic 定义输出模式,保证结构化数据的类型安全和可验证性

不足之处

  • 项目仍处于早期阶段,API 可能频繁变动,生产环境需谨慎
  • 文档和社区生态尚不完善,高级用法需阅读源码

适用场景

  • 自动化处理合同、发票中的关键字段提取
  • 构建企业级文档问答系统,需从非结构化文档中抽取实体
  • 批量处理扫描件或图片,生成结构化数据库记录

替代项目

LangChain、LlamaIndex、Unstructured

项目介绍

ExtractThinker 是开发框架领域的开源项目,由 enoch3712 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,598)位列前 30%,在开发框架分类中处于中上游。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。开源库,Apache-2.0 许可,完全免费,无付费版本。

它主要面向的使用场景是:自动化处理合同、发票中的关键字段提取。同类可对比的替代方案包括 LangChain、LlamaIndex、Unstructured。

上一篇:functionary

下一篇:PromptHub

同类项目推荐

langchain 开源

组装 AI 应用的乐高积木,从想法到上线不换工具

The agent engineering platform.

★ 146874 2026-08-09
transformers 开源

全球最大的模型仓库全家桶,想用的模型一把抓

Transformers: the model-definition framework for state-of-the-art machine learning m···

★ 166529 2026-08-09
pi 开源

一套 TypeScript 工具包,快速搭出能写代码的 AI agent

AI agent toolkit: unified LLM API, agent loop, TUI, coding agent CLI

★ 108504 2026-09-12