doctor

把 PDF、扫描件批量转成可提取文本的微服务

doctor 是一个用 Python 编写的文档转换微服务,目标是在大规模场景下把各种格式的文档统一转成可处理的格式。它解决的是企业或平台中散落的 PDF、图片、Office 文档难以批量提取和转换的问题:通过微服务接口接收文件,内部调用 ffmpeg、OCR、PDF 解析等组件,输出文本或结构化内容。核心能力包括多格式文档接入、OCR 识别扫描件、PDF 内容抽取,以及以服务方式横向扩展处理量。项目定位偏基础设施,适合嵌入已有内容流水线,而不是给终端用户直接使用的工具。当前星标约 134,属于早期项目,接口和部署方式可能还会调整,采用前建议先小规模验证。

开源 free 办公效率
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 134
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类办公效率
开发团队freelawproject
所属国家
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源是
开源协议BSD-2-Clause
主要语言Python
技术栈/模型document,extraction,ffmpeg,ocr,pdf
GitHub 星标★ 134
30天Star增速
HF 下载量
上线时间2020-09-10 00:00:00
最近更新2026-09-28 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-30
浏览次数0

使用教程

核心亮点

  • 以微服务形式提供文档转换,方便接入已有内容处理流水线并横向扩容
  • 集成 OCR 与 PDF 抽取,能处理扫描件和普通 PDF 两类常见来源
  • 基于 Python,依赖 ffmpeg 等成熟组件,二次开发和部署门槛较低

不足之处

  • 项目早期,星标少,接口稳定性和长期维护节奏待观察
  • 文档与社区生态较薄,遇到冷门格式或复杂版式时排查成本可能较高

适用场景

  • 企业知识库批量导入历史 PDF 和扫描件并抽取文本
  • 内容平台把用户上传的多格式文档统一转成可检索文本
  • 数据团队在 ETL 流程中前置一层文档解析微服务

替代项目

Apache Tika、Unstructured

项目介绍

doctor 是办公效率领域的开源项目,由 freelawproject 开发,2020 年首次发布。

它收录于办公效率分类,该分类目前共有 157 个项目,GitHub 星标数为 134。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-28。开源免费,需自行部署。

它主要面向的使用场景是:企业知识库批量导入历史PDF和扫描件并抽取文本。同类可对比的替代方案包括 Apache Tika、Unstructured。

上一篇:compdf-self-hosted

下一篇:没有了!

同类项目推荐

sunshine-control-panel 开源

一站式管理游戏库、监控内存,AI 助手加持,让大屏启动更高效。

Sunshine Foundation 大屏桌面管理器 | Tauri + Vue 3,游戏库管理、米塔AI助手、内存监控···

★ 444 2026-08-09
Stirling PDF 开源

本地部署 PDF 工具箱

#1 PDF Application on GitHub that lets you edit PDFs on any device anywhere

★ 93264 2026-08-19
obsidian-md2wechat 开源

一键将 Obsidian 笔记排版成公众号文章,告别手动调格式

Obsidian → WeChat | Obsidian 插件一键排版发布到微信公众号,键排版发布到微信公众号:···

★ 318 2026-08-09
pdf2md 开源

浏览器里直接把 PDF 变成 Markdown,不用上传,隐私安全。

Browser based tool to convert PDFs to Markdown

★ 381 2026-08-09