document-processing
本站收录 33 个带「document-processing」标签的 AI 开源项目
book-to-skillbook-to-skill 是一个将技术书籍 PDF 转化为 Claude Code 技能(Skill)的开源工具。它解决了开发者阅读技术书籍时难以将知识直接应★ 33,016
liteparseliteparse 是一个用 Rust 编写的高性能开源文档解析器,专注于从 PDF、扫描件和图片中快速提取文本与结构化数据。它解决了传统 OCR 工具速度慢、★ 12,719
pdf-craftpdf-craft 是一个专注于将扫描版 PDF 书籍转换为其他格式的开源工具。它利用 deepseek-ocr 等 OCR 技术,解决扫描 PDF 中文字无法★ 6,337
SenseNova-SkillsSenseNova-Skills 是一个基于 JavaScript 的模块化技能库,旨在帮助开发者快速构建 AI 驱动的办公助手和生产力工作流。它解决了从零搭建★ 5,724
docetlDocETL 是一个面向智能体 LLM 的数据处理与 ETL 系统。它解决传统 ETL 管道无法灵活处理非结构化数据(如文本、日志、文档)的痛点,将大语言模型作★ 4,110
trustgraphtrustgraph 是一个面向开源 AI 的确定性上下文工程平台。它通过将开放模型与本体论(ontologies)结合,利用上下文图(context grap★ 2,763
ExtractThinkerExtractThinker 是一个面向大语言模型的文档智能处理库,采用 ORM 风格的设计,让开发者能以类似数据库操作的方式灵活编排文档工作流。它解决了从复杂★ 1,599
OpenOCROpenOCR 是面向通用 OCR 研究与应用的统一开源工具箱,由国内团队维护。它把 OCR 训练、评测、推理整合到同一套框架中,既提供商业级精度的文字检测与识★ 1,461
pdf_oxidepdf_oxide 是一个用 Rust 编写的高性能 PDF 处理库,提供 Python 和 Rust 双语言接口。它解决了现有 PDF 库处理速度慢、内存占用★ 1,056
eclaireeclaire 是一个本地优先、开源的 AI 助手,旨在统一管理你的个人数据,包括任务、笔记、文档、照片和书签。它解决的是个人数据分散在多个应用、难以统一检索和★ 922
ExtractPDF4JExtractPDF4J 是一个用 Java 编写的 PDF 表格提取与 OCR 库,主要解决从 PDF 中稳定抽取结构化表格数据的问题。它同时支持文本型 PD★ 522
Invoice-DownloaderInvoice-Downloader 是一个面向国内报销场景的电子发票整理工具。它通过 IMAP 协议连接你的邮箱,自动批量下载发票附件,支持 PDF、OFD、★ 464
pdf-to-markdownpdf-to-markdown 是一个将 PDF 文件转换为干净、结构化 Markdown 的 Python 工具。它解决了从 PDF 中提取文本时格式混乱、难★ 207
oxidizePdfoxidizePdf 是一个用纯 Rust 编写的 PDF 处理库,专为 AI 和 RAG 场景设计。它解决了 PDF 在检索增强生成中文本提取结构混乱、分块不★ 192
flexible-graphragflexible-graphrag 是一个基于 Python 的灵活图检索增强生成(GraphRAG)框架,旨在解决传统 RAG 在复杂关系推理和多源数据整合上★ 188
chunkychunky 是一个面向可靠 RAG(检索增强生成)管道的开源工具包,主要解决文档处理与分块环节中的痛点。它提供从 PDF 到 Markdown 的转换、文档清★ 182
official-document-ai-assistant这是一个本地优先的公文写作辅助桌面工具,主要解决机关、企事业单位在公文起草、审核和导出过程中的格式不规范、表述不严谨等问题。它基于Python和FastAPI构★ 165
opendocswork-mcpopendocswork-mcp 是一个用 Rust 编写的 MCP(Model Context Protocol)服务器,专为办公文档处理而生,支持 Exce★ 163
formkiq-coreFormKiQ Core 是一个基于 AWS 托管服务的开源文档管理系统,用 Java 编写,部署在你自己的 AWS 账户中。它解决的是企业文档散落各处、难以统★ 163
document-chat-system这是一个开源的文档对话平台,基于语义搜索和RAG(检索增强生成)技术,让用户能与自己的文档进行自然语言交互。它解决了传统文档检索效率低、无法直接获取答案的问题,★ 147
pdf-mcppdf-mcp 是一个基于 MCP 协议的服务器,旨在让 Claude Code 等 AI 代理高效处理大型 PDF 文件及整个文件夹,避免上下文溢出。它通过混★ 145
office_oxideoffice_oxide 是一个用 Rust 编写的高性能 Office 文档处理库,提供 Python、Rust、Go、JS/TS、C# 和 WASM 多语言★ 138
my-wikimy-wiki 是一个本地优先的 AI 知识管理应用,同时也是智能体技能(Agent Skill)。它旨在解决个人和团队知识碎片化、难以检索和关联的问题。核心能★ 124
local-llm-pdf-ocrlocal-llm-pdf-ocr 是一个把扫描版 PDF 转成可搜索文本的本地工具,核心思路是调用视觉大模型 olmOCR 完成 OCR,全程离线运行,不上传★ 120
MinerU-SkillMinerU-Skill 是一个面向 AI 原生工作流的文档解析工具,能把 PDF、Office 文档和图片统一转换成干净的 Markdown。它重点解决大模型★ 119
docwireDocWire SDK 是一个基于 C++20 的本地优先文档数据处理框架,主打确定性、可审计、可私有化部署的工作流。它解决的是企业或开发者在处理大量异构文档时★ 113
InferrLMInferrLM 是一个面向 iOS 和 Android 的端侧 AI 推理框架,基于 TypeScript 构建,旨在让移动应用无需依赖云端即可运行 AI 模★ 112
compdf-skillsComPDF Skills 是一套面向 AI 编码代理的 PDF 处理技能库,支持 Claude Code、Cursor、Copilot、OpenCode 等 ★ 108
DocMeldDocMeld 是一个轻量级的文档到智能体就绪知识流水线工具,专为处理研究论文和书籍设计。它采用三阶段的 Bronze→Silver→Gold 架构,依次提取结★ 102
rag-tenderrag-tender 是一个面向招投标场景的本地化 RAG 助手,旨在解决标书文件繁多、资质匹配耗时、合规风险难发现等问题。它通过检索增强生成(RAG)技术,对★ 93
ai-assistant-demo这是一个基于PSPDFKit的AI文档助手演示项目,旨在展示如何通过自然语言命令与PDF文档进行交互。它解决了传统PDF操作繁琐、效率低下的问题,让用户可以用日★ 68
PolarisDeskPolarisDesk 是一款基于 TypeScript 开发的 AI 桌面助手,旨在成为办公场景下的智能工作台。它聚合了多家 AI 模型服务商,用户可以在统一★ 62
aiwhispereraiwhisperer 是一个面向 AI 对话场景的 PDF 预处理工具,主要解决大文件超出模型上传限制以及敏感数据泄露风险两大问题。它通过压缩 PDF 体积,★ 53