GutenOCR

用多卡 vLLM 训练评测 VLM,把图片文字识别做准

GutenOCR 是一个面向 OCR 场景的开源工具集,专注于视觉语言模型(VLM)的训练与评测。它解决的核心问题是:传统 OCR 方案在复杂版面、手写体、多语言或低质量图像上表现有限,而直接用通用 VLM 做 OCR 又缺乏标准化训练流程和可复现的评测基准。项目提供训练脚本、多 GPU 分布式支持(基于 vLLM 推理加速),以及一套评测流程,帮助开发者用自有数据微调 VLM 并量化识别效果。核心能力包括:支持多卡并行训练与推理、集成 vLLM 提升吞吐、提供 OCR 专用评测指标与数据管线。适合想快速搭建 VLM-OCR 实验环境的研究者或工程团队,降低从零实现训练与评测的成本。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 191
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类计算机视觉
开发团队bevaya
所属国家
官网地址
定价模式free
价格说明开源免费,无在线服务
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型llms,multigpu,ocr,vllm,vlm-ocr,vlms
GitHub 星标★ 191
30天Star增速
HF 下载量
上线时间2025-12-18 00:00:00
最近更新2026-09-16 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-29
浏览次数0

使用教程

核心亮点

  • 集成 vLLM 推理后端,多 GPU 下 OCR 推理吞吐高
  • 同时覆盖训练与评测,避免自己拼装两套流程
  • 专注 VLM-OCR 细分方向,数据管线和指标更贴合识别任务

不足之处

  • 项目早期,文档和示例可能不完整
  • 社区规模小,遇到问题可参考的 issue 和讨论有限

适用场景

  • 用自有票据/证件数据微调 VLM 做结构化文字识别
  • 在论文或产品中对比不同 VLM 的 OCR 准确率
  • 多卡环境下批量跑图片文字提取任务

替代项目

PaddleOCR、EasyOCR

项目介绍

GutenOCR 是计算机视觉领域的开源项目,由 bevaya 开发,2025 年首次发布。

它收录于计算机视觉分类,该分类目前共有 467 个项目,GitHub 星标数为 191。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-16。开源免费,无在线服务。

它主要面向的使用场景是:用自有票据/证件数据微调VLM做结构化文字识别。同类可对比的替代方案包括 PaddleOCR、EasyOCR。

上一篇:light-ocr

下一篇:AntiCAP

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4045 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90972 2026-08-10
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1431 2026-08-20