zotero-ocr

在 Zotero 里直接给扫描 PDF 做 OCR,文字可搜可引。

zotero-ocr 是一个为文献管理工具 Zotero 开发的 OCR 插件,主要解决扫描版 PDF 无法直接复制、搜索和标注文字的问题。它通过集成 Tesseract OCR 引擎,在 Zotero 内部对 PDF 页面进行文字识别,并将识别结果以注释或附件形式回写,让用户无需离开 Zotero 就能把图片型 PDF 变成可检索、可引用的文本。核心能力包括:对选中条目或附件批量执行 OCR、支持多语言识别、识别结果可保存为笔记或独立文本文件,并与 Zotero 的条目结构关联。插件基于 JavaScript 编写,安装后以 Zotero 扩展形式运行,适合需要处理大量扫描文献的研究者、学生和图书馆员,减少在外部 OCR 工具与文献管理器之间来回切换的成本。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 826
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类计算机视觉
开发团队UB-Mannheim
所属国家
官网地址
定价模式free
价格说明开源免费插件
访问状态
是否开源
开源协议AGPL-3.0
主要语言JavaScript
技术栈/模型hacktoberfest,ocr,tesseract-ocr,zotero,zotero-plugin
GitHub 星标★ 826
30天Star增速
HF 下载量
上线时间2018-10-25 00:00:00
最近更新2026-09-15 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0

使用教程

核心亮点

  • 与 Zotero 深度集成,识别结果直接回写为笔记或附件,不用导出文件再处理
  • 基于 Tesseract,支持多语言识别,覆盖常见扫描文献场景
  • 安装即用,对已有 Zotero 工作流改动小,适合批量处理扫描版 PDF

不足之处

  • 依赖 Tesseract 本地环境,首次配置对非技术用户有一定门槛
  • OCR 准确率受扫描质量和语言包影响,复杂排版或手写内容效果有限

适用场景

  • 研究生整理大量扫描版外文文献,需要快速提取正文做笔记和引用
  • 图书馆员将馆藏扫描 PDF 批量 OCR,提升全文检索能力
  • 写综述时对无法复制文字的旧论文做识别,直接生成可编辑摘录

替代项目

OCRmyPDF、Paperless-ngx

项目介绍

zotero-ocr 是一个计算机视觉领域的开源项目,官方简介:Zotero Plugin for OCR。项目使用 JavaScript 开发,在 GitHub 上获得 826 星标。

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3995 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90893 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2035 2026-08-14