text-extraction

本站收录 13 个带「text-extraction」标签的 AI 开源项目

liteparseliteparse 是一个用 Rust 编写的高性能开源文档解析器,专注于从 PDF、扫描件和图片中快速提取文本与结构化数据。它解决了传统 OCR 工具速度慢、★ 12,719xbergxberg 是一个多语言文档智能框架,核心用 Rust 编写,旨在解决文档解析碎片化问题。它能从 101 种格式(涵盖 115 种文件扩展名)中提取文本、元数据★ 9,356trafilaturaTrafilatura 是一个用 Python 编写的网页文本与元数据抓取工具,同时提供命令行接口。它解决的核心问题是:从杂乱无章的 HTML 页面中精准提取正★ 6,890pdf-craftpdf-craft 是一个专注于将扫描版 PDF 书籍转换为其他格式的开源工具。它利用 deepseek-ocr 等 OCR 技术,解决扫描 PDF 中文字无法★ 6,337pdf_oxidepdf_oxide 是一个用 Rust 编写的高性能 PDF 处理库,提供 Python 和 Rust 双语言接口。它解决了现有 PDF 库处理速度慢、内存占用★ 1,056html-to-markdownhtml-to-markdown 是一个高性能且符合 CommonMark 规范的 HTML 转 Markdown 转换器,由 Kreuzberg 团队维护。它★ 881MinerU-HTMLMinerU-HTML 是一个基于小型语言模型(SLM)的 HTML 主内容提取工具,能够从杂乱网页中提取干净的 HTML 正文。它解决的是网页内容解析中常见的★ 293pdf-to-markdownpdf-to-markdown 是一个将 PDF 文件转换为干净、结构化 Markdown 的 Python 工具。它解决了从 PDF 中提取文本时格式混乱、难★ 207oxidizePdfoxidizePdf 是一个用纯 Rust 编写的 PDF 处理库,专为 AI 和 RAG 场景设计。它解决了 PDF 在检索增强生成中文本提取结构混乱、分块不★ 192office_oxideoffice_oxide 是一个用 Rust 编写的高性能 Office 文档处理库,提供 Python、Rust、Go、JS/TS、C# 和 WASM 多语言★ 138ppu-paddle-ocrppu-paddle-ocr 是一个用 TypeScript 重写的 PaddleOCR 轻量级 SDK,目标是在任何能运行 JavaScript 的环境里做多★ 138docwireDocWire SDK 是一个基于 C++20 的本地优先文档数据处理框架,主打确定性、可审计、可私有化部署的工作流。它解决的是企业或开发者在处理大量异构文档时★ 113aiwhispereraiwhisperer 是一个面向 AI 对话场景的 PDF 预处理工具,主要解决大文件超出模型上传限制以及敏感数据泄露风险两大问题。它通过压缩 PDF 体积,★ 53