scribeocr

浏览器里对照原图改 OCR,扫描件变可编辑文档

ScribeOCR 是一个基于浏览器的 OCR 文字识别与校对工具,目标是把扫描图片、PDF 或已有 OCR 结果变成完全数字化的文档。它本身不训练识别模型,而是整合 Tesseract、ABBYY、HOCR 等识别引擎的输出,在网页里统一展示图片与文字,让用户逐行对照修改。核心能力包括:上传图片或 PDF 自动跑 OCR、导入已有 hOCR/ALTO 结果、在原文与识别文本之间高亮联动、支持多语言识别、导出纯文本或保留排版的结构化文档。相比命令行 OCR 工具,它把“识别—校对—导出”串成可视化流程,适合需要人工复核准确率的场景,比如古籍整理、档案数字化、论文扫描件转文字。项目用 JavaScript 编写,可本地部署,数据不必上传第三方,对隐私敏感用户友好。

开源 unknown 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 811
维护状态 较活跃
是否开源
定价模式 unknown

项目数据

分类计算机视觉
开发团队scribeocr
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议AGPL-3.0
主要语言JavaScript
技术栈/模型abbyy,hocr,ocr,proofreading,tesseract
GitHub 星标★ 811
30天Star增速
HF 下载量
上线时间2022-03-02 00:00:00
最近更新2026-09-14 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0

使用教程

核心亮点

  • 网页内图片与识别文本逐行联动高亮,校对效率比纯文本编辑高
  • 支持导入 Tesseract、ABBYY、hOCR 等多种引擎结果,不绑定单一识别服务
  • 可本地部署,扫描件和识别结果留在自己机器上,隐私可控

不足之处

  • 识别准确率依赖底层引擎,项目本身不做模型优化
  • 界面和文档偏英文,中文用户上手需要适应

适用场景

  • 古籍或档案扫描件数字化,人工逐页校对识别结果
  • 论文、合同扫描 PDF 转可编辑文本并核对关键数字
  • 已有 hOCR/ALTO 结果需要可视化复核和修正

替代项目

OCRmyPDF、Paperless-ngx、tesseract.js

项目介绍

scribeocr 是一个计算机视觉领域的开源项目,官方简介:Web interface for recognizing text, proofreading OCR, and creating fully-digitized documents.。项目使用 JavaScript 开发,在 GitHub 上获得 811 星标。

上一篇:desk-ocr

下一篇:eSearch-OCR

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3973 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90860 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2032 2026-08-14