
scribeocr
浏览器里对照原图改 OCR,扫描件变可编辑文档
ScribeOCR 是一个基于浏览器的 OCR 文字识别与校对工具,目标是把扫描图片、PDF 或已有 OCR 结果变成完全数字化的文档。它本身不训练识别模型,而是整合 Tesseract、ABBYY、HOCR 等识别引擎的输出,在网页里统一展示图片与文字,让用户逐行对照修改。核心能力包括:上传图片或 PDF 自动跑 OCR、导入已有 hOCR/ALTO 结果、在原文与识别文本之间高亮联动、支持多语言识别、导出纯文本或保留排版的结构化文档。相比命令行 OCR 工具,它把“识别—校对—导出”串成可视化流程,适合需要人工复核准确率的场景,比如古籍整理、档案数字化、论文扫描件转文字。项目用 JavaScript 编写,可本地部署,数据不必上传第三方,对隐私敏感用户友好。
开源
unknown
计算机视觉
GitHub 星标
★ 811
维护状态
较活跃
是否开源
是
定价模式
unknown
项目数据
分类计算机视觉
开发团队scribeocr
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议AGPL-3.0
主要语言JavaScript
技术栈/模型abbyy,hocr,ocr,proofreading,tesseract
GitHub 星标★ 811
30天Star增速
HF 下载量
上线时间2022-03-02 00:00:00
最近更新2026-09-14 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0
使用教程
核心亮点
- 网页内图片与识别文本逐行联动高亮,校对效率比纯文本编辑高
- 支持导入 Tesseract、ABBYY、hOCR 等多种引擎结果,不绑定单一识别服务
- 可本地部署,扫描件和识别结果留在自己机器上,隐私可控
不足之处
- 识别准确率依赖底层引擎,项目本身不做模型优化
- 界面和文档偏英文,中文用户上手需要适应
适用场景
- 古籍或档案扫描件数字化,人工逐页校对识别结果
- 论文、合同扫描 PDF 转可编辑文本并核对关键数字
- 已有 hOCR/ALTO 结果需要可视化复核和修正
替代项目
OCRmyPDF、Paperless-ngx、tesseract.js
项目介绍
上一篇:desk-ocr
下一篇:eSearch-OCR
同类项目推荐
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3