
OCR4all
古籍扫描件上传,自动识别加人工校对,一键导出文本
OCR4all 是一个面向历史文献与古籍数字化的开源 OCR 平台,通过 Web 应用提供从图像预处理、版面分析、文本识别到人工校对与导出的完整工作流。它解决的核心问题是:普通 OCR 工具对老旧印刷体、复杂版面、历史字体识别效果差,且缺少可交互的校对环境。项目集成了多种 OCR 引擎(如 Tesseract、OCRopus 等),允许用户上传扫描图像、自动分割文本区域、选择识别模型,并在浏览器中逐行修正识别结果,最终导出 ALTO XML、TEI 或纯文本。其 Java 后端与 Web 前端结合,适合图书馆、档案馆和数字人文研究者批量处理珍本古籍,降低人工转录成本,同时保留可追溯的校对记录。
开源
free
计算机视觉
GitHub 星标
★ 709
维护状态
活跃
是否开源
是
定价模式
free
项目数据
分类计算机视觉
开发团队OCR4all
所属国家
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源是
开源协议MIT
主要语言Java
技术栈/模型
GitHub 星标★ 709
30天Star增速
HF 下载量
上线时间2019-01-23 00:00:00
最近更新2026-09-14 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0
使用教程
核心亮点
- 提供完整的 Web 端 OCR 工作流,从图像预处理到校对导出无需切换工具
- 针对历史文献优化,支持复杂版面和多种 OCR 引擎切换
- 内置人工校对界面,可逐行修正并保留修改记录,适合学术级数字化
不足之处
- 项目早期,文档和部署指南可能不够完善,上手门槛较高
- 依赖 Java 环境及多个外部 OCR 引擎,安装配置较复杂
适用场景
- 图书馆或档案馆批量数字化古籍善本
- 数字人文研究者处理历史报刊与手稿
- 需要人工校对环节的学术文本转录项目
替代项目
Tesseract、OCRmyPDF
项目介绍
上一篇:MonkeyOCRv2
下一篇:kraken
同类项目推荐
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3