receipt-ocr

拍张票据照片,自动提取金额日期等关键字段

receipt-ocr 是一个面向小票、发票等票据图像的 OCR 处理引擎,用 Python 编写。它要解决的问题是:普通 OCR 工具直接识别票据时,由于版式复杂、字体小、背景噪声多,往往输出一堆杂乱文本,难以直接使用。该项目在 Tesseract/pytesseract 基础上做了针对票据场景的封装与优化,并引入 LLM 能力辅助识别与结构化,把图像中的关键字段(如金额、日期、商家名、商品明细)提取出来,输出更干净、更可用的结果。核心能力包括票据图像预处理、OCR 文本识别、基于大模型的后处理与字段抽取,适合需要批量处理收据、报销单、账单的场景。项目标签覆盖 invoice-ocr、llm-ocr、pytesseract 等,说明它走的是传统 OCR 加 LLM 增强的混合路线,对想快速搭建票据识别流水线的开发者比较友好。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 710
维护状态 活跃
是否开源
定价模式 free

项目数据

分类计算机视觉
开发团队bhimrazy
所属国家
官网地址
定价模式free
价格说明开源免费,PyPI包可自行安装使用
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型hacktoberfest,invoice-ocr,invoice-ocr-python,llm,llm-ocr,ocr,ocr-engine,pytesseract,python-ocr,tesseract-ocr
GitHub 星标★ 710
30天Star增速
HF 下载量
上线时间2023-12-01 00:00:00
最近更新2026-09-15 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

核心亮点

  • 在 Tesseract 之上针对票据版式做封装,比裸用 pytesseract 更省事
  • 结合 LLM 做后处理,能把杂乱 OCR 文本整理成结构化字段
  • Python 实现,依赖常见,便于二次开发和集成到现有流程

不足之处

  • 强依赖 Tesseract 和外部 LLM,识别质量受底层引擎与模型影响
  • 票据版式多样,复杂或低质量图像的准确率仍需自行验证

适用场景

  • 企业财务批量识别员工报销小票并录入系统
  • 个人记账时拍照提取消费金额和商家信息
  • 发票/账单自动化归档,按字段建立可检索数据库

替代项目

PaddleOCR、EasyOCR

项目介绍

receipt-ocr 是一个计算机视觉领域的开源项目,官方简介:An efficient OCR engine for receipt image processing.。项目使用 Python 开发,在 GitHub 上获得 710 星标。

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3995 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90893 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2035 2026-08-14