docext

无需 OCR,本地快速将文档转为 Markdown,并支持效果评测。

docext 是一个本地部署的、无需 OCR 的非结构化数据提取与 Markdown 转换工具包,同时提供基准测试能力。它主要解决企业从 PDF、Word、扫描件等复杂文档中高效提取文本和结构信息的问题,无需依赖 OCR 即可处理数字原生文档,并能将结果转换为 Markdown 格式,便于下游处理。核心能力包括:支持多种文档格式解析、高精度内容提取、Markdown 转换、以及配套的基准测试框架(如 IDP Leaderboard),帮助用户评估和对比不同提取方案。项目采用 Python 实现,适合集成到现有数据管道中,强调隐私安全(on-premises),适合对数据敏感的企业场景。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2086
维护状态 低维护
是否开源
定价模式 free

项目数据

分类搜索知识
开发团队NanoNets
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,本地部署,完全免费。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型document,document-analysis,document-data-extraction,document-information-extraction,extraction,llm-ocr,llms,machine-learning,nlp,ocr,ocr-benchmark,ocr-onpremise,onprem,onprem-ocr,onprem-vision,onpremise,rag,table-extraction,unstructured-data,vlms
GitHub 星标★ 2086
30天Star增速
HF 下载量
上线时间2025-03-25 00:00:00
最近更新2026-09-19 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 运行环境及 pip(README 未标注具体版本)
  • 可访问 PyPI 的网络,用于安装 docext 包
  • 本地/私有化部署环境(项目定位为 on-premises)
  • 处理图片转 Markdown 时需具备视觉语言模型相关资源(README 未给出具体依赖)

安装与启动步骤

  1. 1准备运行环境

    README 未标注 Python 版本要求,请先确认本机已装好 Python 与 pip,并清理好工作目录。

  2. 2安装 docext

    从 PyPI 安装官方发布的 docext 包;建议在虚拟环境中执行,避免污染全局依赖。

    pip install docext
  3. 3Colab 快速试用

    官方提供 Colab 笔记本,可跳过本地环境,直接体验文档转 Markdown 与信息抽取效果。

  4. 4了解三项能力

    工具包含 PDF/图片转 Markdown、文档信息抽取、基准测试三块,按需选择使用方式。

如何确认成功

pip 安装无报错,且在 Python 中导入 docext 无异常即表示环境可用(README 未给出官方自检命令)。

常见问题

Q:docext 需要依赖 OCR 吗?

A:不需要。README 强调它是 OCR-free 方案,基于视觉语言模型直接解析文档,适合数字原生文件。

Q:可以完全私有化部署吗?

A:可以。项目定位为 on-premises 工具包,文档与数据可留在本地环境,适合对数据敏感的场景。

Q:docext 具体能做什么?

A:三件事:PDF/图片转结构化 Markdown、从发票护照等文档抽取字段与表格、用基准测试评估对比抽取方案。

Q:有没有配套的模型可用?

A:官方发布了 Nanonets-OCR-s,3B 参数的图片转 Markdown 模型,可在 Hugging Face 获取。

注意事项

  • README 节选未提供完整安装与配置说明,具体参数、入口和用法请以 GitHub 仓库和官网文档为准。
  • 项目强调本地部署与隐私安全,适合企业数据合规场景。
  • 配套的 Nanonets-OCR-s 模型权重需前往 Hugging Face 获取,README 未说明显存与许可要求。
  • 避免凭空猜测端口、路径或环境变量,运行前请先查阅官方示例。

核心亮点

  • 无需 OCR 即可处理数字文档,提取速度快且成本低
  • 提供 IDP Leaderboard 基准测试,可量化对比提取效果
  • 支持本地部署,保障企业数据隐私安全

不足之处

  • 对扫描件或手写文档支持有限,依赖数字文本层
  • 文档/社区待观察

适用场景

  • 企业知识库构建,将存量 PDF 转为 Markdown 便于检索
  • RAG 管道中的文档预处理,提升检索质量
  • 文档解析效果评测,选择最优提取方案

替代项目

unstructured、docling、marker

项目介绍

docext 是办公效率领域的开源项目,由 NanoNets 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,086)位列前 30%,在办公效率分类中处于中上游。

近 42 天,它的 GitHub 星标从 2,035 增加到 2,086,净增 51。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-19。Apache-2.0 许可证,本地部署,完全免费。

它主要面向的使用场景是:企业知识库构建,将存量PDF转为Markdown便于检索。同类可对比的替代方案包括 unstructured、docling、marker。

上一篇:note-gen

下一篇:WorkShadow

同类项目推荐

sunshine-control-panel 开源

一站式管理游戏库、监控内存,AI 助手加持,让大屏启动更高效。

Sunshine Foundation 大屏桌面管理器 | Tauri + Vue 3,游戏库管理、米塔AI助手、内存监控···

★ 444 2026-08-09
Stirling PDF 开源

本地部署 PDF 工具箱

#1 PDF Application on GitHub that lets you edit PDFs on any device anywhere

★ 92816 2026-08-19
obsidian-md2wechat 开源

一键将 Obsidian 笔记排版成公众号文章,告别手动调格式

Obsidian → WeChat | Obsidian 插件一键排版发布到微信公众号,键排版发布到微信公众号:···

★ 314 2026-08-09
pdf2md 开源

浏览器里直接把 PDF 变成 Markdown,不用上传,隐私安全。

Browser based tool to convert PDFs to Markdown

★ 378 2026-08-09