surya

多语言文档一键 OCR,版面表格阅读顺序全搞定

Surya 是一个面向文档智能的开源工具包,核心解决多语言文档的 OCR 与结构化理解问题。它不仅能做传统文字识别,还覆盖版面分析、阅读顺序推断和表格识别,支持 90 多种语言,适合处理扫描件、PDF 截图、复杂排版文档等真实场景。项目以 Python 实现,提供命令行和 Python API,可输出文字位置、行/段落结构、表格单元格和阅读顺序,方便下游做检索、信息抽取或 RAG。相比只做纯 OCR 的方案,Surya 更强调“理解版面”,让机器知道文字属于哪一栏、哪张表、按什么顺序读,从而提升文档解析质量。它常被用于构建文档问答、票据处理、学术论文解析和知识库入库等流程,是开源文档 AI 中较完整的一站式选择。

开源 freemium 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 21396
维护状态 较活跃
是否开源
定价模式 freemium

项目数据

分类计算机视觉
开发团队datalab-to
所属国家
定价模式freemium
价格说明开源模型免费,Datalab云服务提供免费额度及付费套餐
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 21396
30天Star增速
HF 下载量
上线时间2024-01-10 00:00:00
最近更新2026-09-18 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 环境与 pip(README 使用 pip 安装)
  • 可联网,首次使用会下载模型权重(Surya 为 650M 参数 OCR 模型)
  • 建议具备 GPU,README 提到在 RTX 5090 上吞吐约 5 pages/s
  • 如做二次开发需安装 uv(手动安装方式使用 uv)

安装与启动步骤

  1. 1安装 Surya

    用 pip 从 PyPI 安装 surya-ocr,会一并装好运行所需的依赖。

    pip install surya-ocr
  2. 2开发者手动安装

    需要改源码时用 uv 方式:克隆仓库、同步运行时与开发依赖,再在虚拟环境中运行。

    git clone https://github.com/datalab-to/surya.git
    cd surya
    uv sync --group dev
  3. 3配置推理后端

    可选。默认首次使用会自动拉起推理管理器,也可用环境变量指向已有服务或切换后端。

    export SURYA_INFERENCE_URL=http://host:port/v1
    export SURYA_INFERENCE_BACKEND=vllm
  4. 4运行 OCR

    README 未给出具体参数示例,先查看命令帮助确认可用选项,再对文档执行识别。

    surya_ocr --help
  5. 5查看可调设置

    所有设置集中在 surya/settings.py,任意设置都可用同名环境变量覆盖。

关键配置

配置项必填说明示例
SURYA_INFERENCE_URL指向已有推理服务地址,避免自动启动本地推理服务http://host:port/v1
SURYA_INFERENCE_BACKEND指定推理后端,例如 vllmvllm
surya/settings.py 中的设置项目全部可调设置,均支持用环境变量覆盖见 surya/settings.py

如何确认成功

执行 surya_ocr 命令能正常加载模型并输出识别结果(首次会自动下载权重),说明安装成功。

常见问题

Q:可以免费商用吗?

A:代码为 Apache 2.0;模型权重为修改版 AI Pubs Open Rail-M,研究、个人使用及融资/营收低于 500 万美元的初创可免费,更大范围商用需申请授权。

Q:如何接入已有推理服务?

A:设置环境变量 SURYA_INFERENCE_URL=http://host:port/v1 指向该服务即可,无需本地自动拉起推理服务。

Q:支持哪些语言?

A:支持多语言,在 91 种语言的内部基准集上得分为 87.2%,可处理多语言文档。

Q:Surya 2 包含哪些能力?

A:通过单一 VLM 完成版面分析、OCR 和表格识别,并输出阅读顺序与表格行列结构。

注意事项

  • 代码与模型权重许可不同,商用前请确认是否符合 Open Rail-M 的免费条件。
  • 首次调用会自动启动推理管理器并下载模型,需保证网络与磁盘空间充足。
  • 文本检测与 OCR 是分开的模型,出错时可分别排查。
  • README 中命令行参数以省略号形式给出,实际参数请以 surya_ocr --help 输出为准。

核心亮点

  • 支持 90+ 语言 OCR,多语言文档场景覆盖广
  • 同时提供版面分析、阅读顺序和表格识别,输出结构化信息而非纯文本
  • Python 实现,提供 CLI 与 API,易于集成到文档解析和 RAG 流程

不足之处

  • 模型体积和推理资源占用较大,轻量部署需额外优化
  • 复杂表格和低质量扫描件的识别精度仍有提升空间

适用场景

  • 扫描版 PDF 或图片文档批量转结构化文本
  • 多语言合同、票据、论文的版面与表格信息抽取
  • 为 RAG 知识库构建高质量文档解析与阅读顺序还原

替代项目

PaddleOCR、MinerU、docTR

项目介绍

surya 是一个计算机视觉领域的开源项目,官方简介:OCR, layout analysis, reading order, table recognition in 90+ languages。项目使用 Python 开发,在 GitHub 上获得 21396 星标。

上一篇:CHINESE-OCR

下一篇:HunyuanOCR

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3995 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90893 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2035 2026-08-14