PaDT 是计算机视觉领域的开源项目,由 Gorilla-Lab-SCUT 开发,2025 年首次发布。
它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 165。
项目仍在小幅维护中,最近一次代码更新于 2026-08-10。Apache-2.0 许可证,可自由使用,无付费版本。
它主要面向的使用场景是:多模态大模型研究:探索统一视觉任务建模。同类可对比的替代方案包括 UniT、Mask2Former、X-Decoder。

把图像切成 token,一个模型搞定分割、检测、姿态估计
PaDT 是一个面向多模态大语言模型(MLLM)的统一视觉任务框架,其核心思想是将图像分割为可解码的视觉 token(Patch-as-Decodable-Token),从而让模型能够同时处理多种视觉任务,如分割、检测、姿态估计等。该项目解决了传统 MLLM 在视觉任务上需要特定任务头或复杂适配器的问题,通过将视觉信息转化为模型可直接解码的 token,实现了任务间的统一建模。其核心能力包括:支持多种视觉任务的联合训练与推理、灵活的 token 解码机制、以及基于 ICLR 2026 论文的官方实现。项目代码基于 Python,处于早期开发阶段(164 星标),但提供了清晰的架构和实验配置,适合研究者和开发者探索多模态统一模型的新范式。
UniT、Mask2Former、X-Decoder
PaDT 是计算机视觉领域的开源项目,由 Gorilla-Lab-SCUT 开发,2025 年首次发布。
它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 165。
项目仍在小幅维护中,最近一次代码更新于 2026-08-10。Apache-2.0 许可证,可自由使用,无付费版本。
它主要面向的使用场景是:多模态大模型研究:探索统一视觉任务建模。同类可对比的替代方案包括 UniT、Mask2Former、X-Decoder。
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
Olympus
开源
一个路由搞定所有视觉任务,免去逐个微调
[CVPR 2025 Highlight] Official code for "Olympus: A Universal Task Router for Comput···