PaDT

把图像切成 token,一个模型搞定分割、检测、姿态估计

PaDT 是一个面向多模态大语言模型(MLLM)的统一视觉任务框架,其核心思想是将图像分割为可解码的视觉 token(Patch-as-Decodable-Token),从而让模型能够同时处理多种视觉任务,如分割、检测、姿态估计等。该项目解决了传统 MLLM 在视觉任务上需要特定任务头或复杂适配器的问题,通过将视觉信息转化为模型可直接解码的 token,实现了任务间的统一建模。其核心能力包括:支持多种视觉任务的联合训练与推理、灵活的 token 解码机制、以及基于 ICLR 2026 论文的官方实现。项目代码基于 Python,处于早期开发阶段(164 星标),但提供了清晰的架构和实验配置,适合研究者和开发者探索多模态统一模型的新范式。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 165
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队Gorilla-Lab-SCUT
所属国家
官网地址
定价模式free
价格说明开源模型,Apache-2.0 许可证,可自由使用,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型computer-vision,large-language-models,machine-learning,multimodal-large-language-models,patch-as-decodable-token
GitHub 星标★ 165
30天Star增速
HF 下载量
上线时间2025-09-26 00:00:00
最近更新2026-08-10 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 统一框架:用单一解码 token 机制覆盖多种视觉任务,减少任务特定模块
  • 论文官方实现:ICLR 2026 论文代码,算法有理论支撑
  • 架构清晰:代码结构模块化,便于二次开发和实验复现

不足之处

  • 早期项目:星标少,社区生态和文档尚不完善
  • 依赖特定 MLLM 基础,可能对硬件资源要求较高

适用场景

  • 多模态大模型研究:探索统一视觉任务建模
  • 自动驾驶感知:同时处理目标检测、分割和姿态估计
  • 智能交互系统:实现图像理解与生成式任务的融合

替代项目

UniT、Mask2Former、X-Decoder

项目介绍

PaDT 是计算机视觉领域的开源项目,由 Gorilla-Lab-SCUT 开发,2025 年首次发布。

它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 165。

项目仍在小幅维护中,最近一次代码更新于 2026-08-10。Apache-2.0 许可证,可自由使用,无付费版本。

它主要面向的使用场景是:多模态大模型研究:探索统一视觉任务建模。同类可对比的替代方案包括 UniT、Mask2Former、X-Decoder。

上一篇:Sa2VA

下一篇:GLiNER

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
Olympus 开源

一个路由搞定所有视觉任务,免去逐个微调

[CVPR 2025 Highlight] Official code for "Olympus: A Universal Task Router for Comput···

★ 427 2026-08-09