
franken_ocr
不装 Python 不靠 GPU,纯 Rust 在 CPU 上跑 3B OCR 大模型
franken_ocr 是一个用纯 Rust 实现的 CPU 端 OCR 推理引擎,目标模型是百度 Unlimited-OCR——一个基于 DeepSeek-OCR 衍生、参数量约 3B 的 MoE 视觉语言模型。它最大的特点是彻底脱离主流机器学习框架:不依赖 PyTorch、ONNX Runtime 或任何 Python 运行时,也不使用 GPU,而是手写 int8/int4 量化算子与 SIMD 内核(覆盖 AVX-512、NEON 等指令集),直接在 CPU 上完成视觉编码与文本生成。项目提供五模型 zoo,可按精度与速度取舍。它解决的是部署侧痛点:在无 GPU 的服务器、边缘设备或需要静态编译分发的场景中,传统 VLM 推理栈过重、依赖复杂。核心能力包括量化推理、跨 x86/ARM 的 SIMD 加速、以及纯 Rust 带来的单二进制部署体验。
项目数据
使用教程
核心亮点
- 纯 Rust 实现,无 Python、无 ML 框架依赖,可编译为单一静态二进制,部署链路极短
- 手写 int8/int4 量化内核并针对 AVX-512 与 NEON 优化,在 CPU 上压榨 MoE 模型推理性能
- 提供五模型 zoo,用户可在精度、体积和速度之间按场景灵活取舍
不足之处
- 项目处于早期,仅 326 星,社区规模小,长期维护与问题响应待观察
- CPU-only 推理 3B MoE 模型,绝对速度与吞吐无法与 GPU 方案相比,长文档场景可能受限
适用场景
- 无 GPU 的私有化服务器或内网环境部署 OCR 服务
- 边缘设备或 ARM 平台(如 NEON 设备)上做本地文字识别
- 需要单二进制、免依赖分发的桌面或嵌入式 Rust 应用集成 OCR
替代项目
PaddleOCR、Tesseract、RapidOCR
项目介绍
上一篇:ocr-rs
下一篇:pdf-ocr-obsidian
同类项目推荐
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3