MambaVision

混合Mamba与Transformer,让视觉模型在高分辨率下又快又准

MambaVision是CVPR 2025官方发布的PyTorch实现,提出了一种混合Mamba-Transformer视觉骨干网络。它针对视觉任务中Mamba模型在捕捉全局上下文时效率不足的问题,通过重新设计Mamba块并结合Transformer的自注意力机制,构建了高效的混合架构。该模型在ImageNet分类、COCO目标检测和ADE20K语义分割等主流视觉基准上,实现了精度与吞吐量的最佳平衡,尤其在高分辨率图像处理上展现出显著的速度优势。核心能力包括:可扩展的模型系列(MambaVision-T/S/B/L)、支持2D扫描策略优化、以及通过替换自注意力层来无缝集成到现有视觉Transformer框架中。项目提供了完整的训练、评估和预训练权重,便于研究者直接使用和二次开发。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2235
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队NVlabs
所属国家
官网地址
定价模式free
价格说明开源模型,基于PyTorch实现,可自行部署使用,完全免费。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型deep-learning,foundation-models,huggingface-transformers,hybrid-models,image-classification,instance-segmentation,mamba,object-detection,self-attention,semantic-segmentation,transformers,vision-transformer,visual-recognition
GitHub 星标★ 2235
30天Star增速
HF 下载量
上线时间2024-06-10 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 5 步

环境要求

  • Python 环境(README 未指定具体版本)
  • 已安装较新版本的 PyTorch(README 明确以此为前提)
  • 可用的 pip 包管理环境
  • 可选:Docker(仓库提供了 Dockerfile)

安装与启动步骤

  1. 1获取项目代码

    从 GitHub 克隆官方仓库并进入项目目录,后续所有命令都在该目录下执行。

    git clone https://github.com/NVlabs/MambaVision.git
    cd MambaVision
  2. 2安装 PyTorch

    README 假定环境已装好较新的 PyTorch;请按 pytorch.org 的官方指引选择匹配自己 CUDA 版本的安装命令,README 未指定版本号。

  3. 3安装项目依赖

    在已装好 PyTorch 的前提下,执行 README 给出的命令安装 requirements.txt 中的依赖。建议在虚拟环境中进行。

    pip install -r requirements.txt
  4. 4用 Docker 构建

    可选方案:仓库根目录提供了 Dockerfile,如需容器化运行可自行构建镜像;README 未给出具体构建参数。

    docker build -t mambavision .
  5. 5快速试用

    README 提供官方 Colab Notebook,不想本地配置环境时可直接打开链接在线体验。

如何确认成功

README 未给出验证命令;依赖安装无报错且能正常导入 MambaVision 模块即视为环境就绪。

常见问题

Q:PyTorch 要装哪个版本?

A:README 只说明需安装较新的 PyTorch,并未锁定版本。请前往 pytorch.org 的安装引导页,按自己的操作系统与 CUDA 版本选择对应命令安装。

Q:Docker 和 pip 两种方式怎么选?

A:仓库同时提供 Dockerfile 和 requirements.txt。已有 PyTorch 环境时直接 pip 安装依赖最省事;希望环境隔离则用 Dockerfile 自行构建镜像。

Q:不想本地安装环境怎么办?

A:README 顶部提供了官方的 Google Colab 链接,可以直接在浏览器中打开运行,无需本地配置。

Q:依赖安装失败怎么办?

A:先确认 PyTorch 已正确安装并可正常导入,再执行 pip install -r requirements.txt;建议使用独立的虚拟环境避免版本冲突。

注意事项

  • README 未提供版本号、端口、权重下载路径等细节,本文只覆盖其明确写出的安装方式。
  • 安装前务必先自行准备好 PyTorch,这是 README 的明确前提。
  • 仓库根目录提供 Dockerfile,可用于容器化部署。
  • 商用授权需通过 NVIDIA Research Licensing 页面提交表单咨询。

核心亮点

  • 在ImageNet-1K上,MambaVision-B达到85.3% top-1精度,比同规模ViT快3倍
  • 支持2D扫描策略,有效捕获全局上下文,解决Mamba在视觉任务中的方向敏感问题
  • 提供T/S/B/L四种模型,并附带预训练权重,可直接替换自注意力层集成到现有框架

不足之处

  • 模型参数量和计算量仍较大,在资源受限设备上部署有挑战
  • 文档和社区支持相对有限,生态不如成熟Transformer库丰富

适用场景

  • 高分辨率图像分类任务,如医学影像、卫星图像分析
  • 实时目标检测和语义分割,需要高吞吐量的视觉应用
  • 作为视觉骨干网络,替换现有ViT或Swin Transformer以提升效率

替代项目

Vision Mamba (Vim)、VMamba、Swin Transformer

项目介绍

MambaVision 是计算机视觉领域的开源项目,由 NVlabs 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,235)位列前 30%,在计算机视觉分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。基于PyTorch实现,可自行部署使用,完全免费。

它主要面向的使用场景是:高分辨率图像分类任务,如医学影像、卫星图像分析。同类可对比的替代方案包括 Vision Mamba (Vim)、VMamba、Swin Transformer。

上一篇:EVA

下一篇:torchxrayvision

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14