tesseract

在 R 里一行代码把图片文字变成数据框

tesseract 是一个为 R 语言提供 Tesseract OCR 引擎绑定的开源包,让 R 用户无需离开统计与数据分析环境即可对图片做文字识别。它解决的核心问题是:R 在图像文本提取方面能力薄弱,而 Tesseract 本身是 C++ 项目,直接调用门槛高。该包封装了引擎的初始化、语言包选择、页面分割模式、识别引擎模式等参数,提供 ocr()、ocr_data() 等接口,可返回纯文本或带置信度、边界框的结构化数据,方便后续用 dplyr 等工具清洗与分析。它支持多语言识别、PDF 与图片输入,并可与 magick 包配合做预处理。对于需要批量处理扫描件、发票、报表并直接进入 R 数据管道的用户,它把 OCR 变成了一个普通的函数调用。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 252
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类计算机视觉
开发团队ropensci
所属国家
定价模式free
价格说明开源免费,基于 Apache 2.0 许可证
访问状态
是否开源
开源协议
主要语言R
技术栈/模型ocr,r,r-package,rstats,tesseract,tesseract-ocr
GitHub 星标★ 252
30天Star增速
HF 下载量
上线时间2016-03-02 00:00:00
最近更新2026-09-15 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0

使用教程

核心亮点

  • 提供 ocr_data() 返回逐词置信度与边界框,可直接接入 tidyverse 做结构化分析
  • 封装 Tesseract 的页面分割模式、引擎模式、语言包等参数,无需写 C++ 即可调优
  • 与 magick 包协同,可在 R 内完成灰度、二值化等预处理再识别

不足之处

  • 依赖系统级 Tesseract 与语言包安装,跨平台部署易踩环境坑
  • 仅做绑定封装,识别精度完全受 Tesseract 引擎限制,无深度学习增强

适用场景

  • 批量识别扫描版 PDF 报表并转成数据框分析
  • 从发票或收据图片中抽取字段做财务对账
  • 学术研究中把历史文献扫描件转文本后做词频统计

替代项目

tesseract.js、pytesseract

项目介绍

tesseract 是一个计算机视觉领域的开源项目,官方简介:Bindings to Tesseract OCR engine for R。项目使用 R 开发,在 GitHub 上获得 252 星标。

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3995 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90893 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2035 2026-08-14