extractous

一条命令提取所有文档内容,快如闪电

extractous 是一个用 Rust 编写的高性能非结构化数据提取库,旨在解决从 PDF、Word、HTML、图片等各类文件中快速提取文本和元数据的问题。它提供统一的 API,支持多种语言绑定(如 Python、Java、Node.js 等),让开发者无需处理底层格式细节。核心能力包括:支持超过 20 种文件格式的解析、流式处理大文件、自动检测文件类型、以及可扩展的解析器架构。相比传统工具(如 Apache Tika),extractous 在速度和内存占用上具有显著优势,适合用于搜索引擎索引、文档分析、RAG 流水线等场景。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1781
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队yobix-ai
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Rust
技术栈/模型data-pipelines,docx,etl,etl-pipelines,extraction,llm,machine-learning,natural-language-processing,nlp,ocr,pdf,pdf-parser,rag,rust,tika,unstructured,unstructured-data
GitHub 星标★ 1781
30天Star增速
HF 下载量
上线时间2024-06-04 00:00:00
最近更新2026-09-20 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 可访问 GitHub 的网络环境,用于克隆仓库
  • Rust 工具链(项目核心用 Rust 编写,如需从源码构建)
  • 按所选语言绑定准备对应运行时:Python、Java 或 Node.js

安装与启动步骤

  1. 1确认信息范围

    本次 README 节选只含项目介绍与 Quickstart 标题,未提供任何安装命令,需以仓库完整 README 为准。

  2. 2克隆官方仓库

    从 GitHub 拉取源码,后续可在仓库的 Quickstart 与各语言绑定目录中查找实际安装命令。

    git clone https://github.com/yobix-ai/extractous.git
  3. 3阅读 Quickstart

    进入仓库后打开 README 的 Quickstart 章节,按其中示例选择对应语言绑定,不要自行猜测包名。

    cd extractous
  4. 4选择语言绑定

    项目提供 Python、Java、Node.js 等多语言绑定,按你的技术栈选用对应绑定并查看其说明。

  5. 5准备测试文件

    准备 PDF、Word、HTML 等样本文档,用于按 README 示例验证文本与元数据提取效果。

如何确认成功

README 节选中未给出启动或验证命令,需按仓库 Quickstart 中对应语言绑定的示例代码运行并确认能输出提取文本。

常见问题

Q:需要调用外部 API 或部署服务吗?

A:不需要。README 明确说明 Extractous 的初衷就是摆脱外部服务与 API,在本地高效完成内容提取。

Q:支持哪些文件格式?

A:README 提到支持 PDF、Word、HTML 等多种格式,完整格式清单见仓库 README 的 supported-file-formats 章节。

Q:和 unstructured-io 相比性能如何?

A:README 的演示称 Extractous 比 unstructured-io 快 25 倍,完整基准测试见其 benchmarking 仓库。

Q:有哪些语言的绑定?

A:项目定位是为 Rust 核心提供多语言绑定,README 提到包括 Python、Java、Node.js 等,具体以仓库说明为准。

注意事项

  • 本 README 节选未包含任何安装命令,steps 仅为通用准备动作,安装请务必以仓库完整 README 的 Quickstart 为准。
  • 不要凭本教程臆测包名、版本号、端口或参数,所有命令应来自官方文档。
  • 项目为库/依赖形态,通常集成到你的代码中调用,而非独立运行的服务。

核心亮点

  • Rust 实现,提取速度远超同类 Python/Java 库
  • 支持 20+ 格式,覆盖常见办公文档、PDF、图片 OCR
  • 提供多语言绑定,无缝集成到现有技术栈

不足之处

  • 项目较新,API 可能不稳定
  • 文档/社区待观察

适用场景

  • 构建搜索引擎或 RAG 系统的文档预处理
  • 批量提取合同、报告等非结构化数据用于分析
  • 在资源受限环境中快速解析大文件

替代项目

Apache Tika、Unstructured、textract

项目介绍

extractous 是基础设施领域的开源项目,由 yobix-ai 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,781)位列前 30%,在基础设施分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-20。Apache-2.0 许可证,可免费使用和部署。

它主要面向的使用场景是:构建搜索引擎或RAG系统的文档预处理。同类可对比的替代方案包括 Apache Tika、Unstructured、textract。

上一篇:kernel-memory

下一篇:trench

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09