
surya
多语言文档一键 OCR,版面表格阅读顺序全搞定
Surya 是一个面向文档智能的开源工具包,核心解决多语言文档的 OCR 与结构化理解问题。它不仅能做传统文字识别,还覆盖版面分析、阅读顺序推断和表格识别,支持 90 多种语言,适合处理扫描件、PDF 截图、复杂排版文档等真实场景。项目以 Python 实现,提供命令行和 Python API,可输出文字位置、行/段落结构、表格单元格和阅读顺序,方便下游做检索、信息抽取或 RAG。相比只做纯 OCR 的方案,Surya 更强调“理解版面”,让机器知道文字属于哪一栏、哪张表、按什么顺序读,从而提升文档解析质量。它常被用于构建文档问答、票据处理、学术论文解析和知识库入库等流程,是开源文档 AI 中较完整的一站式选择。
项目数据
使用教程
环境要求
- Python 环境与 pip(README 使用 pip 安装)
- 可联网,首次使用会下载模型权重(Surya 为 650M 参数 OCR 模型)
- 建议具备 GPU,README 提到在 RTX 5090 上吞吐约 5 pages/s
- 如做二次开发需安装 uv(手动安装方式使用 uv)
安装与启动步骤
-
1安装 Surya
用 pip 从 PyPI 安装 surya-ocr,会一并装好运行所需的依赖。
pip install surya-ocr -
2开发者手动安装
需要改源码时用 uv 方式:克隆仓库、同步运行时与开发依赖,再在虚拟环境中运行。
git clone https://github.com/datalab-to/surya.git cd surya uv sync --group dev -
3配置推理后端
可选。默认首次使用会自动拉起推理管理器,也可用环境变量指向已有服务或切换后端。
export SURYA_INFERENCE_URL=http://host:port/v1 export SURYA_INFERENCE_BACKEND=vllm -
4运行 OCR
README 未给出具体参数示例,先查看命令帮助确认可用选项,再对文档执行识别。
surya_ocr --help -
5查看可调设置
所有设置集中在 surya/settings.py,任意设置都可用同名环境变量覆盖。
关键配置
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
SURYA_INFERENCE_URL | 否 | 指向已有推理服务地址,避免自动启动本地推理服务 | http://host:port/v1 |
SURYA_INFERENCE_BACKEND | 否 | 指定推理后端,例如 vllm | vllm |
surya/settings.py 中的设置 | 否 | 项目全部可调设置,均支持用环境变量覆盖 | 见 surya/settings.py |
如何确认成功
执行 surya_ocr 命令能正常加载模型并输出识别结果(首次会自动下载权重),说明安装成功。
常见问题
Q:可以免费商用吗?
A:代码为 Apache 2.0;模型权重为修改版 AI Pubs Open Rail-M,研究、个人使用及融资/营收低于 500 万美元的初创可免费,更大范围商用需申请授权。
Q:如何接入已有推理服务?
A:设置环境变量 SURYA_INFERENCE_URL=http://host:port/v1 指向该服务即可,无需本地自动拉起推理服务。
Q:支持哪些语言?
A:支持多语言,在 91 种语言的内部基准集上得分为 87.2%,可处理多语言文档。
Q:Surya 2 包含哪些能力?
A:通过单一 VLM 完成版面分析、OCR 和表格识别,并输出阅读顺序与表格行列结构。
注意事项
- 代码与模型权重许可不同,商用前请确认是否符合 Open Rail-M 的免费条件。
- 首次调用会自动启动推理管理器并下载模型,需保证网络与磁盘空间充足。
- 文本检测与 OCR 是分开的模型,出错时可分别排查。
- README 中命令行参数以省略号形式给出,实际参数请以 surya_ocr --help 输出为准。
核心亮点
- 支持 90+ 语言 OCR,多语言文档场景覆盖广
- 同时提供版面分析、阅读顺序和表格识别,输出结构化信息而非纯文本
- Python 实现,提供 CLI 与 API,易于集成到文档解析和 RAG 流程
不足之处
- 模型体积和推理资源占用较大,轻量部署需额外优化
- 复杂表格和低质量扫描件的识别精度仍有提升空间
适用场景
- 扫描版 PDF 或图片文档批量转结构化文本
- 多语言合同、票据、论文的版面与表格信息抽取
- 为 RAG 知识库构建高质量文档解析与阅读顺序还原
替代项目
PaddleOCR、MinerU、docTR
项目介绍
上一篇:CHINESE-OCR
下一篇:HunyuanOCR
同类项目推荐
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3