GutenOCR 是计算机视觉领域的开源项目,由 bevaya 开发,2025 年首次发布。
它收录于计算机视觉分类,该分类目前共有 467 个项目,GitHub 星标数为 191。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-16。开源免费,无在线服务。
它主要面向的使用场景是:用自有票据/证件数据微调VLM做结构化文字识别。同类可对比的替代方案包括 PaddleOCR、EasyOCR。

用多卡 vLLM 训练评测 VLM,把图片文字识别做准
GutenOCR 是一个面向 OCR 场景的开源工具集,专注于视觉语言模型(VLM)的训练与评测。它解决的核心问题是:传统 OCR 方案在复杂版面、手写体、多语言或低质量图像上表现有限,而直接用通用 VLM 做 OCR 又缺乏标准化训练流程和可复现的评测基准。项目提供训练脚本、多 GPU 分布式支持(基于 vLLM 推理加速),以及一套评测流程,帮助开发者用自有数据微调 VLM 并量化识别效果。核心能力包括:支持多卡并行训练与推理、集成 vLLM 提升吞吐、提供 OCR 专用评测指标与数据管线。适合想快速搭建 VLM-OCR 实验环境的研究者或工程团队,降低从零实现训练与评测的成本。
PaddleOCR、EasyOCR
GutenOCR 是计算机视觉领域的开源项目,由 bevaya 开发,2025 年首次发布。
它收录于计算机视觉分类,该分类目前共有 467 个项目,GitHub 星标数为 191。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-16。开源免费,无在线服务。
它主要面向的使用场景是:用自有票据/证件数据微调VLM做结构化文字识别。同类可对比的替代方案包括 PaddleOCR、EasyOCR。
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档