tesseract

图片转文字,准确率高,开源免费随便用

Tesseract 是当前最知名的开源 OCR(光学字符识别)引擎,由惠普实验室诞生、Google 主导维护。它解决的核心问题是从图片中提取文字,支持超过 100 种语言的识别,并内置基于 LSTM 的深度学习模型,大幅提升了对印刷体和手写体的识别准确率。其核心能力包括:多语言文本识别、版面分析、倾斜校正、字符级置信度输出,以及通过训练自定义模型来适配特定字体或领域。Tesseract 提供命令行工具和 C++ API,并可通过 Python 的 pytesseract 等封装库轻松集成,广泛应用于文档数字化、票据识别、车牌识别、辅助阅读等场景。作为成熟稳定的开源项目,它拥有庞大的社区和丰富的文档,是 OCR 领域的事实标准之一。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 76624
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类计算机视觉
开发团队tesseract-ocr
所属国家
定价模式free
价格说明完全免费的开源OCR引擎,可本地部署使用,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言C++
技术栈/模型hacktoberfest,lstm,machine-learning,ocr,ocr-engine,tesseract,tesseract-ocr
GitHub 星标★ 76624
30天Star增速
HF 下载量
上线时间2014-08-12 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 6 步

环境要求

  • 已安装 tesseract 命令行程序(可用预编译二进制包或源码编译)
  • 源码编译需系统具备受支持的 C++ 编译器
  • 已下载所需的 traineddata 语言数据文件(如 eng)
  • 待识别的图片文件(如 image.png)

安装与启动步骤

  1. 1选择安装方式

    README 给出两条路:使用官方预编译二进制包,或从源码构建。具体命令见官方 Installation / Compiling 文档。

  2. 2准备语言数据

    识别需要 traineddata 文件,可从官方 tessdata 仓库获取,并放到 Tesseract 能找到的 tessdata 目录。

  3. 3执行基础识别

    最简调用:把图片名和输出前缀交给 tesseract,识别结果按 output 前缀输出。

    tesseract image.png output
  4. 4指定识别语言

    用 -l 参数选择语言,例如 eng。多语言支持依赖已安装的对应 traineddata 文件。

    tesseract image.png output -l eng
  5. 5切换识别引擎

    Tesseract 4 默认用 LSTM 引擎;加 --oem 0 可启用兼容 Tesseract 3 的旧引擎(需配套 traineddata)。

    tesseract image.png output -l eng --oem 0
  6. 6查看命令行帮助

    忘记参数时查看帮助,可了解 --oem、--psm、configfiles 等全部选项说明。

    tesseract --help

关键配置

配置项必填说明示例
outputbase是输出结果文件的前缀名,命令中的位置参数。output
-l否指定识别语言,需对应的 traineddata 文件。-l eng
--oem否选择 OCR 引擎模式,0 为兼容 Tesseract 3 的旧引擎。--oem 0
--psm否页面分割模式,控制版面分析方式,取值见官方文档。--psm pagesegmode

如何确认成功

运行 tesseract --help 能正常打印帮助信息;执行识别命令后无报错,并按 outputbase 生成识别结果文件。

常见问题

Q:识别结果不准或识别不了中文怎么办?

A:检查是否安装了对应语言的 traineddata 文件,并用 -l 指定该语言;数据文件可从官方 tessdata 仓库获取。

Q:为什么要用 --oem 0?

A:Tesseract 4 默认使用 LSTM 引擎,只做行识别;--oem 0 用于启用 Tesseract 3 的旧引擎,且需要支持旧引擎的 traineddata。

Q:--psm 参数该填什么?

A:README 未列出具体取值,请通过 tesseract --help 或官方 Command-Line-Usage 文档查询各页面分割模式。

Q:安装命令在哪里找?

A:README 只给出官方文档链接:预编译包见 Installation 页面,源码编译见 Compiling 页面,按对应系统说明操作。

注意事项

  • Tesseract 4 默认启用基于 LSTM 的神经网络 OCR 引擎,聚焦行识别,同时保留 Tesseract 3 传统引擎。
  • 旧引擎模式需要额外的 traineddata 文件支持,使用 --oem 0 前先确认数据齐全。
  • Tesseract 支持 Unicode(UTF-8),可识别上百种语言。
  • README 未提供具体安装命令与端口等细节,安装前请先查阅官网 Installation / Compiling 文档。

核心亮点

  • 识别语言超100种,覆盖全球主流文字
  • 基于LSTM深度学习,印刷体识别准确率业界领先
  • 提供命令行和C++/Python API,集成灵活

不足之处

  • 对手写体和复杂背景图片识别效果一般
  • 文档/社区待观察

适用场景

  • 文档扫描件转可编辑文本
  • 自动化处理发票、表单等票据信息提取
  • 为视障人士提供图像文字朗读辅助

替代项目

PaddleOCR、EasyOCR、Kraken

项目介绍

tesseract 是计算机视觉领域的开源项目,由 tesseract-ocr 开发,2014 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(76,624)位列前 1%,在计算机视觉分类的 446 个项目里位列前 1%。

近 44 天,它的 GitHub 星标从 75,834 增加到 76,624,净增 790。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。完全免费的开源OCR引擎,可本地部署使用,无付费版本。

它主要面向的使用场景是:文档扫描件转可编辑文本。同类可对比的替代方案包括 PaddleOCR、EasyOCR、Kraken。

上一篇:pcl

下一篇:paperless-ngx

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14