
GutenOCR
用 VLM 做 OCR 的训练评测一条龙工具
GutenOCR 是一个面向 OCR 场景的开源工具集,专注于视觉语言模型(VLM)的训练与评测。它解决的核心问题是:传统 OCR 方案在复杂版式、手写体或低质量图像上表现不稳定,而直接使用通用 VLM 做 OCR 又缺乏标准化训练流程和可复现的评测基准。项目提供从数据准备、多 GPU 分布式训练到基于 vLLM 的高效推理评测的完整链路,支持对 VLM 进行 OCR 专项微调,并给出统一的准确率、鲁棒性等评估指标。技术栈基于 Python,集成 LLM、多卡训练、vLLM 等组件,适合研究者快速搭建 VLM-OCR 实验管线,也方便工程团队对比不同模型在真实文档上的识别效果。当前星标约 191,属于早期项目,但方向明确,填补了 VLM 用于 OCR 时训练与评测工具链的空白。
开源
free
计算机视觉
GitHub 星标
★ 191
维护状态
活跃
是否开源
是
定价模式
free
项目数据
分类计算机视觉
开发团队Roots-Automation
所属国家
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型llms,multigpu,ocr,vllm,vlm-ocr,vlms
GitHub 星标★ 191
30天Star增速
HF 下载量
上线时间2025-12-18 00:00:00
最近更新2026-09-16 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0
使用教程
核心亮点
- 提供从数据到训练再到 vLLM 推理评测的完整闭环,减少重复搭建成本
- 支持多 GPU 分布式训练,能直接用于较大规模 VLM 的 OCR 微调
- 评测环节基于 vLLM,推理吞吐高,适合批量对比不同模型效果
不足之处
- 项目处于早期,文档和示例可能不够完善,上手需要一定调试
- 社区规模小,遇到问题可参考的 issue 和讨论有限
适用场景
- 研究者微调视觉语言模型以提升特定文档(如发票、古籍)的 OCR 准确率
- 工程团队批量评测多个 VLM 在真实业务图片上的 OCR 表现并选型
- 需要多卡训练 OCR 模型但不想从零搭建训练与评测脚本的团队
替代项目
PaddleOCR、EasyOCR
项目介绍
上一篇:DTrOCR
下一篇:caption_ocr_tool
同类项目推荐
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3