document-parsing
本站收录 17 个带「document-parsing」标签的 AI 开源项目
PaddleOCRPaddleOCR 是百度开源的 OCR 工具库,旨在将任意 PDF 或图片文档转化为结构化数据,供 AI 系统使用。它解决了图像和 PDF 中文字信息难以被机★ 90,415
opendataloader-pdfopendataloader-pdf 是一个专为 AI 数据准备而设计的 PDF 解析器,旨在将 PDF 文档自动转换为 AI 可读的结构化数据。它解决了传统 ★ 29,401
unstructuredUnstructured 是一个开源的 ETL 工具,专注于将复杂文档(如 PDF、Word、PPT、图片等)转换为干净、结构化的数据,以便直接用于大语言模型(★ 15,519
ExtractThinkerExtractThinker 是一个面向大语言模型的文档智能处理库,采用 ORM 风格的设计,让开发者能以类似数据库操作的方式灵活编排文档工作流。它解决了从复杂★ 1,599
docstrangedocstrange 是一个基于 Python 的文档数据提取与转换工具,旨在解决从多种文档格式(如 PDF、Word、PPT、图片及 URL)中高效提取结构化★ 1,574
OpenOCROpenOCR 是面向通用 OCR 研究与应用的统一开源工具箱,由国内团队维护。它把 OCR 训练、评测、推理整合到同一套框架中,既提供商业级精度的文字检测与识★ 1,461
TurboOCRTurboOCR 是一个基于 C++ 实现的高性能 OCR 服务,专为追求极致吞吐量的场景设计。它集成了百度飞桨的 PP-OCRv6 模型,并利用 Tensor★ 1,098
haiku.raghaiku.rag 是一个基于 LanceDB、Pydantic AI 和 Docling 构建的 agentic RAG(检索增强生成)框架,主打“有主见”(★ 615
ParseBenchParseBench 是一个面向 AI Agent 的文档解析基准测试工具,旨在解决 LLM 应用中文档解析能力难以量化评估的问题。它提供了一套标准化的评测流程★ 592
MimirQMimirQ 是一个面向中文企业场景的 RAG 知识库解决方案,核心解决企业文档解析难、检索不准、引用不可控的问题。它提供从文档解析、数据治理、智能切块到混合检★ 558
NexusRAGNexusRAG 是一个混合检索增强生成(RAG)系统,旨在解决传统向量检索在复杂查询中上下文缺失、答案不准确的问题。它结合了向量搜索、知识图谱(基于 Ligh★ 530
docling-Studiodocling-Studio 是一个基于 Docling 的可视化文档分析工作台,面向需要处理 PDF 等复杂文档的开发者与数据团队。它把文档解析流水线搬到浏览★ 262
Flamehaven-FilesearchFlamehaven-Filesearch 是一个自托管的 RAG 搜索引擎,旨在解决个人或团队在本地文件检索中面临的格式多样、语义理解不足和部署复杂等问题。它★ 109
DocSentinelDocSentinel 是一个面向网络安全领域的 MCP 服务器,专为 AI 智能体设计,用于自动化评估文档、问卷和报告。它解决安全团队在人工审阅合规文档时效率★ 87
ChurroChurro 是一个面向历史文献转录的 OCR 工具包,旨在以高精度和低成本让手写及印刷的历史资料变得可读。它基于 Python 构建,专门处理古籍、档案等复杂★ 79
Visual-ERMVisual-ERM 是一个用于视觉等价性奖励建模的开源项目,提供了论文《Visual-ERM: Reward Modeling for Visual Equi★ 67
papercastpapercast 是一个基于 Python 的管道工具和插件生态系统,用于将技术文档(如 arXiv 论文、SemanticScholar 条目或本地 PDF★ 52