Pix2Text

图片直接转 Markdown,公式表格全搞定,免费替代 Mathpix

Pix2Text 是一个开源的 Python3 工具,旨在将图片中的版面、表格、数学公式和文字识别并转换为 Markdown 格式。它使用小型模型,支持 80 多种语言,是 Mathpix 的免费替代品。该项目解决的核心问题是:如何将复杂的视觉内容(如学术论文、书籍扫描件、手写笔记)高效、准确地转化为可编辑的文本表示,尤其擅长处理数学公式和表格。其核心能力包括版面分析、表格识别、数学公式识别(LaTeX)和 OCR 文字识别,并整合为端到端的图像转 Markdown 流程。模型设计轻量,适合在本地或资源受限环境部署,为科研、教育、文档数字化等领域提供便捷工具。

开源 freemium 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3224
维护状态 活跃
是否开源
定价模式 freemium

项目数据

分类计算机视觉
开发团队breezedeus
所属国家
定价模式freemium
价格说明开源免费,提供在线Demo,高级功能或云服务可能收费
访问状态
是否开源
开源协议MIT
主要语言Jupyter Notebook
技术栈/模型image-to-markdown,latex,latex-pdf,layout-analysis,math-formula,math-formula-recognition,math-ocr,mathpix,ocr,python,pytorch,table-ocr
GitHub 星标★ 3224
30天Star增速
HF 下载量
上线时间2022-09-07 00:00:00
最近更新2026-08-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-24
浏览次数0

核心亮点

  • 支持版面、表格、公式、文字一站式识别,直接输出 Markdown,流程完整
  • 模型体积小,可本地部署,无需依赖云端服务,保护数据隐私
  • 支持 80+ 语言,覆盖广泛,适合多语言文档处理

不足之处

  • 复杂表格和手写公式的识别准确率可能不及商业产品(如 Mathpix)
  • 文档和社区生态相对较小,示例和教程有待丰富

适用场景

  • 学术论文和书籍的数字化,将扫描版 PDF 转为可编辑 Markdown
  • 教育场景中,教师或学生将板书、讲义图片转为文本笔记
  • 科研人员快速提取论文中的公式和表格,用于写作或二次编辑

替代项目

Mathpix、Tesseract OCR、LaTeX-OCR

项目介绍

Pix2Text 是一个计算机视觉领域的开源项目,官方简介:An Open-Source Python3 tool with SMALL models for recognizing layouts, tables, math formulas (LaTeX), and text in images, converting them into Markdown format. A free alternative to Mathpix, empowering seamless conversion of visual content into text-based representations. 80+ languages are supported.。项目使用 Jupyter Notebook 开发,在 GitHub 上获得 3224 星标。

上一篇:OpenCVTutorials

下一篇:没有了!

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3551 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90558 2026-08-10
geti 开源

少数据快训练,轻松搞定计算机视觉模型

Build computer vision models in a fraction of the time and with less data.

★ 1316 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1429 2026-08-20