document-analysis
本站收录 10 个带「document-analysis」标签的 AI 开源项目
MinerUMinerU 是一个开源工具,能将 PDF、Word 等复杂文档转换为适合大语言模型(LLM)使用的 Markdown 或 JSON 格式。它解决了非结构化文档★ 80,837
docetlDocETL 是一个面向智能体 LLM 的数据处理与 ETL 系统。它解决传统 ETL 管道无法灵活处理非结构化数据(如文本、日志、文档)的痛点,将大语言模型作★ 4,110
docextdocext 是一个本地部署的、无需 OCR 的非结构化数据提取与 Markdown 转换工具包,同时提供基准测试能力。它主要解决企业从 PDF、Word、扫描★ 2,086
OpenOCROpenOCR 是面向通用 OCR 研究与应用的统一开源工具箱,由国内团队维护。它把 OCR 训练、评测、推理整合到同一套框架中,既提供商业级精度的文字检测与识★ 1,461
llmdocparserllmdocparser 是一个基于 Python 的 PDF 解析与内容分析工具,它利用大型语言模型(LLM)来理解和提取 PDF 文档中的结构化信息。该项目★ 267
ContractGuardContractGuard 是一个基于 Python 的 AI 智能体,用于快速审查合同。用户上传合同文件后,它能自动识别其中的风险条款、不公平条款,并用通俗易★ 167
cognithorCognithor 是一个本地优先的自主智能体操作系统,旨在解决 AI 代理在复杂任务中的自主运行和长期记忆问题。它支持 19 家 LLM 提供商、18 种通信★ 158
docmind-ai-llmDocMind AI 是一个基于 Streamlit 的开源文档分析应用,核心思路是把 LlamaIndex、LangGraph 与本地大模型串起来,让用户在自★ 155
MatryoshkaMatryoshka 是一个基于 MCP(模型上下文协议)的服务器,专为大型文档分析设计,通过 REPL(交互式编程环境)状态实现高 token 效率。它解决的★ 149
due-diligence-agents这是一个开源的并购尽职调查智能体系统,旨在解决传统尽调中法律、财务等各领域专家各自为战、难以交叉验证的问题。系统由13个AI代理组成,覆盖法律、财务、商业、技术★ 112