
zotero-ocr
在 Zotero 里直接给扫描 PDF 做 OCR,文字可搜可引。
zotero-ocr 是一个为文献管理工具 Zotero 开发的 OCR 插件,主要解决扫描版 PDF 无法直接复制、搜索和标注文字的问题。它通过集成 Tesseract OCR 引擎,在 Zotero 内部对 PDF 页面进行文字识别,并将识别结果以注释或附件形式回写,让用户无需离开 Zotero 就能把图片型 PDF 变成可检索、可引用的文本。核心能力包括:对选中条目或附件批量执行 OCR、支持多语言识别、识别结果可保存为笔记或独立文本文件,并与 Zotero 的条目结构关联。插件基于 JavaScript 编写,安装后以 Zotero 扩展形式运行,适合需要处理大量扫描文献的研究者、学生和图书馆员,减少在外部 OCR 工具与文献管理器之间来回切换的成本。
开源
free
计算机视觉
GitHub 星标
★ 826
维护状态
较活跃
是否开源
是
定价模式
free
项目数据
分类计算机视觉
开发团队UB-Mannheim
所属国家
定价模式free
价格说明开源免费插件
访问状态
是否开源是
开源协议AGPL-3.0
主要语言JavaScript
技术栈/模型hacktoberfest,ocr,tesseract-ocr,zotero,zotero-plugin
GitHub 星标★ 826
30天Star增速
HF 下载量
上线时间2018-10-25 00:00:00
最近更新2026-09-15 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0
使用教程
核心亮点
- 与 Zotero 深度集成,识别结果直接回写为笔记或附件,不用导出文件再处理
- 基于 Tesseract,支持多语言识别,覆盖常见扫描文献场景
- 安装即用,对已有 Zotero 工作流改动小,适合批量处理扫描版 PDF
不足之处
- 依赖 Tesseract 本地环境,首次配置对非技术用户有一定门槛
- OCR 准确率受扫描质量和语言包影响,复杂排版或手写内容效果有限
适用场景
- 研究生整理大量扫描版外文文献,需要快速提取正文做笔记和引用
- 图书馆员将馆藏扫描 PDF 批量 OCR,提升全文检索能力
- 写综述时对无法复制文字的旧论文做识别,直接生成可编辑摘录
替代项目
OCRmyPDF、Paperless-ngx
项目介绍
同类项目推荐
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3