Pix2Text

图片直接转 Markdown,公式表格全搞定,免费替代 Mathpix

Pix2Text 是一个开源的 Python3 工具,旨在将图片中的版面、表格、数学公式和文字识别并转换为 Markdown 格式。它使用小型模型,支持 80 多种语言,是 Mathpix 的免费替代品。该项目解决的核心问题是:如何将复杂的视觉内容(如学术论文、书籍扫描件、手写笔记)高效、准确地转化为可编辑的文本表示,尤其擅长处理数学公式和表格。其核心能力包括版面分析、表格识别、数学公式识别(LaTeX)和 OCR 文字识别,并整合为端到端的图像转 Markdown 流程。模型设计轻量,适合在本地或资源受限环境部署,为科研、教育、文档数字化等领域提供便捷工具。

开源 freemium 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3268
维护状态 维护中
是否开源 是
定价模式 freemium

项目预览

项目数据

分类计算机视觉
开发团队breezedeus
所属国家
定价模式freemium
价格说明开源免费,提供在线Demo,高级功能或云服务可能收费
访问状态
是否开源是
开源协议MIT
主要语言Jupyter Notebook
技术栈/模型image-to-markdown,latex,latex-pdf,layout-analysis,math-formula,math-formula-recognition,math-ocr,mathpix,ocr,python,pytorch,table-ocr
GitHub 星标★ 3268
30天Star增速
HF 下载量
上线时间2022-09-07 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-24
浏览次数7

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python3 环境(项目为 Python3 工具)
  • 可用的 pip 包管理工具
  • 网络可访问 PyPI;下载慢时可指定镜像源
  • 如需识别英文和简体中文之外的语言,需额外安装 multilingual 支持

安装与启动步骤

  1. 1确认 Python 环境

    Pix2Text 是 Python3 工具,先确认本机已安装 Python3 与 pip。README 未给出具体版本号要求。

    python --version
    pip --version
  2. 2安装 Pix2Text

    README 给出的最简安装方式,一条命令即可完成基础安装(默认支持英文和简体中文)。

    pip install pix2text
  3. 3安装多语言支持

    如果需要识别英文和简体中文之外的语言,用这条命令安装额外的语言包。

    pip install pix2text[multilingual]
  4. 4使用镜像源加速

    安装较慢时可指定安装源,README 以阿里云源为例,适用于上述各条安装命令。

    pip install pix2text -i https://mirrors.aliyun.com/pypi/simple
  5. 5安装 VLM 支持

    V1.1.3 起支持基于 VLM 接口的 VlmTableOCR 与 VlmTextFormulaOCR,可调用闭源 VLM 模型。

    pip install pix2text[vlm]

如何确认成功

导入 pix2text 无报错即安装成功(如 python -c "import pix2text");具体使用请按官方文档 Usage 页面操作。

常见问题

Q:安装速度很慢怎么办?

A:可在命令后指定安装源,README 示例为阿里云源:pip install pix2text -i https://mirrors.aliyun.com/pypi/simple。

Q:能识别英文和简体中文之外的语言吗?

A:可以,需要额外安装语言包:pip install pix2text[multilingual],README 说明该命令用于安装额外包。

Q:想用闭源 VLM 模型做表格或文字公式识别?

A:安装 pip install pix2text[vlm],可基于 LiteLLM 接口使用 VLM 模型,示例见 tests/test_vlm.py 与 tests/test_pix2text.py。

Q:安装后怎么使用?

A:README 未在本节给出使用代码,请参考官方文档 Usage 页面:https://pix2text.readthedocs.io/zh-cn/stable/usage/。

注意事项

  • 以上安装命令均直接来自 README 的 Install 章节。
  • V1.1.4 起默认配置、文档与示例统一使用 mfd-1.5 与 mfr-1.5 模型。
  • 不想本地安装可先试用官网在线服务:https://p2t.breezedeus.com。
  • 更多安装细节见官方文档 Install 页面:https://pix2text.readthedocs.io/zh-cn/stable/install/。

核心亮点

  • 支持版面、表格、公式、文字一站式识别,直接输出 Markdown,流程完整
  • 模型体积小,可本地部署,无需依赖云端服务,保护数据隐私
  • 支持 80+ 语言,覆盖广泛,适合多语言文档处理

不足之处

  • 复杂表格和手写公式的识别准确率可能不及商业产品(如 Mathpix)
  • 文档和社区生态相对较小,示例和教程有待丰富

适用场景

  • 学术论文和书籍的数字化,将扫描版 PDF 转为可编辑 Markdown
  • 教育场景中,教师或学生将板书、讲义图片转为文本笔记
  • 科研人员快速提取论文中的公式和表格,用于写作或二次编辑

替代项目

Mathpix、Tesseract OCR、LaTeX-OCR

项目介绍

Pix2Text 是计算机视觉领域的开源项目,由 breezedeus 开发,2022 年首次发布。

在全站 13,916 个收录项目中,它的 GitHub 星标数(3,268)位列前 30%,在计算机视觉分类的 494 个项目里位列前 12%。

近 45 天,它的 GitHub 星标从 3,224 增加到 3,268,净增 44。

项目仍在小幅维护中,最近一次代码更新于 2026-08-23。开源免费,提供在线Demo,高级功能或云服务可能收费。从国内网络环境看,访问稳定性一般,建议自备网络条件。

它主要面向的使用场景是:学术论文和书籍的数字化,将扫描版PDF转为可编辑Markdown。同类可对比的替代方案包括 Mathpix、Tesseract OCR、LaTeX-OCR。

上一篇:OpenCVTutorials

下一篇:clearcam

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4152 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 91101 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1432 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2049 2026-08-14