WeVisDoc 是计算机视觉领域的开源项目,由 Tencent 开发,是 2026 年新上线的项目。
它收录于计算机视觉分类,该分类目前共有 495 个项目,GitHub 星标数为 466。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-18。基于Qwen3-VL微调,免费使用。
它主要面向的使用场景是:把扫描版论文或教材图片批量转成带公式的Markdown笔记。同类可对比的替代方案包括 MinerU、Nougat、GOT-OCR2.0。

整页文档图一键转结构化 Markdown,公式表格都不丢
WeVisDoc 是一个面向文档解析的端到端开源模型,基于 Qwen3-VL-2B-Instruct 与 Qwen3-VL-4B-Instruct 微调而来。它解决的核心问题是:把扫描件、PDF 截图或拍照得到的整页文档图像,自动转换成结构化的 Markdown 文本,而不是只做简单的 OCR 文字识别。模型能够识别页面版式,输出带标题层级的 Markdown,同时把数学公式还原成 LaTeX、把表格还原成 HTML 表格,保留原始文档的语义结构。项目用 Python 实现,提供 2B 和 4B 两个参数规模,方便在精度与显存之间取舍,适合需要批量把纸质或图片资料数字化的场景。相比通用多模态大模型,它针对文档解析任务做了专门微调,输出格式更稳定、更贴近下游可用的结构化结果。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
MinerU、Nougat、GOT-OCR2.0
WeVisDoc 是计算机视觉领域的开源项目,由 Tencent 开发,是 2026 年新上线的项目。
它收录于计算机视觉分类,该分类目前共有 495 个项目,GitHub 星标数为 466。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-18。基于Qwen3-VL微调,免费使用。
它主要面向的使用场景是:把扫描版论文或教材图片批量转成带公式的Markdown笔记。同类可对比的替代方案包括 MinerU、Nougat、GOT-OCR2.0。
上一篇:EvoVLM
下一篇:没有了!
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3