GiT

一个Transformer搞定分类、检测、分割和生成,视觉任务不再分家。

GiT是一个面向通用视觉任务的Transformer模型,源自ECCV 2024 Oral论文。它通过统一的语言接口,将图像分类、目标检测、图像分割和图像生成等不同视觉任务统一建模为序列生成问题,从而让一个模型同时处理多种视觉任务。GiT的核心创新在于其简洁的架构设计,无需复杂的任务特定头或模块,仅依靠Transformer和语言接口就能实现多任务学习。该模型解决了传统视觉模型任务专用、难以泛化的问题,展示了视觉Transformer在通用视觉理解与生成方面的潜力。项目提供了官方实现代码和预训练模型,方便研究者和开发者复现和进一步探索。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 365
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队Haiyang-W
所属国家
官网地址
定价模式free
价格说明开源项目,基于Apache-2.0许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型foundation-models,perception,transformer,unified,vision-and-language,vision-transformer
GitHub 星标★ 365
30天Star增速
HF 下载量
上线时间2024-03-07 00:00:00
最近更新2026-09-14 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 统一语言接口设计,将多种视觉任务统一为序列生成,架构简洁优雅
  • ECCV 2024 Oral论文,理论创新性强,学术认可度高
  • 官方代码开源,提供预训练模型,便于快速上手和复现

不足之处

  • 项目处于早期阶段,文档和社区支持待观察
  • 模型规模可能较大,对计算资源要求较高,部署成本不低

适用场景

  • 学术研究:探索通用视觉Transformer架构与多任务学习
  • 多任务视觉应用:需要同时处理检测、分割等任务的场景
  • 视觉生成与理解统一:希望用单一模型完成多种视觉任务

替代项目

UniT、OFA、Flamingo

项目介绍

GiT 是计算机视觉领域的开源项目,由 Haiyang-W 开发,2024 年首次发布。

它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 365。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-14。基于Apache-2.0许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:学术研究:探索通用视觉Transformer架构与多任务学习。同类可对比的替代方案包括 UniT、OFA、Flamingo。

上一篇:STU-Net

下一篇:depth_any_camera

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
Olympus 开源

一个路由搞定所有视觉任务,免去逐个微调

[CVPR 2025 Highlight] Official code for "Olympus: A Universal Task Router for Comput···

★ 427 2026-08-09