GutenOCR

用 VLM 做 OCR 的训练评测一条龙工具

GutenOCR 是一个面向 OCR 场景的开源工具集,专注于视觉语言模型(VLM)的训练与评测。它解决的核心问题是:传统 OCR 方案在复杂版式、手写体或低质量图像上表现不稳定,而直接使用通用 VLM 做 OCR 又缺乏标准化训练流程和可复现的评测基准。项目提供从数据准备、多 GPU 分布式训练到基于 vLLM 的高效推理评测的完整链路,支持对 VLM 进行 OCR 专项微调,并给出统一的准确率、鲁棒性等评估指标。技术栈基于 Python,集成 LLM、多卡训练、vLLM 等组件,适合研究者快速搭建 VLM-OCR 实验管线,也方便工程团队对比不同模型在真实文档上的识别效果。当前星标约 191,属于早期项目,但方向明确,填补了 VLM 用于 OCR 时训练与评测工具链的空白。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 191
维护状态 活跃
是否开源
定价模式 free

项目数据

分类计算机视觉
开发团队Roots-Automation
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型llms,multigpu,ocr,vllm,vlm-ocr,vlms
GitHub 星标★ 191
30天Star增速
HF 下载量
上线时间2025-12-18 00:00:00
最近更新2026-09-16 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0

使用教程

核心亮点

  • 提供从数据到训练再到 vLLM 推理评测的完整闭环,减少重复搭建成本
  • 支持多 GPU 分布式训练,能直接用于较大规模 VLM 的 OCR 微调
  • 评测环节基于 vLLM,推理吞吐高,适合批量对比不同模型效果

不足之处

  • 项目处于早期,文档和示例可能不够完善,上手需要一定调试
  • 社区规模小,遇到问题可参考的 issue 和讨论有限

适用场景

  • 研究者微调视觉语言模型以提升特定文档(如发票、古籍)的 OCR 准确率
  • 工程团队批量评测多个 VLM 在真实业务图片上的 OCR 表现并选型
  • 需要多卡训练 OCR 模型但不想从零搭建训练与评测脚本的团队

替代项目

PaddleOCR、EasyOCR

项目介绍

GutenOCR 是一个计算机视觉领域的开源项目,官方简介:Open-source tools for training and evaluating Vision Language Models for OCR。项目使用 Python 开发,在 GitHub 上获得 191 星标。

上一篇:DTrOCR

下一篇:caption_ocr_tool

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3995 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90893 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2035 2026-08-14