Sa2VA

一句话指挥AI分割图像视频,精准定位目标

Sa2VA 是一个面向图像与视频分割任务的统一视觉语言模型代码库,由 Pixel-LLM 团队维护。它解决了传统分割模型难以理解自然语言指令并完成复杂时空分割的问题,核心能力包括:通过语言指令实现指代分割(Referring Segmentation)、视频对象分割(VOS)以及视频理解与分割的联合任务。项目整合了多个前沿模型,如 Sa2VA(T-PAMI-26)、SAMTok(CVPR-26)、VRT(Arxiv-25)等,并提供 SaSa2VA 作为 LSVOS 挑战赛的冠军方案。代码库基于 Python 和 PyTorch 构建,支持多模态输入(文本、图像、视频),强调模块化设计与易用性,适合研究者和开发者进行二次开发与实验。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1678
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队bytedance
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型computer-vision,large-language-models,mllm
GitHub 星标★ 1678
30天Star增速
HF 下载量
上线时间2025-01-06 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 6 步

环境要求

  • Python 环境(依赖由 pyproject.toml 声明、uv.lock 锁定)
  • 已安装 uv 工具(README 使用 uv sync 创建虚拟环境)
  • 已克隆 Sa2VA 仓库(后续均在仓库根目录操作)
  • HuggingFace token / OpenRouter API key(填入 .env 供脚本自动加载)

安装与启动步骤

  1. 1克隆仓库

    把 Sa2VA 代码库拉到本地并进入仓库根目录,后续所有命令都在根目录执行。

    git clone https://github.com/bytedance/Sa2VA.git
    cd Sa2VA
  2. 2脚本一键配置

    在仓库根目录执行 setup_env.sh,传项目名 sa2va 与环境类型。InternVL2.5 或更早的骨干用 legacy。

    bash setup_env.sh sa2va legacy
  3. 3手动创建环境

    不想用脚本时手动进入项目目录,用 uv sync 按锁定版本安装依赖;--extra 可选 latest 或 legacy。

    cd projects/sa2va
    uv sync --extra=latest
  4. 4激活虚拟环境

    回到仓库根目录激活 uv 创建的环境,激活后训练与评测脚本才能找到依赖。

    source projects/sa2va/.venv/bin/activate
  5. 5配置密钥文件

    复制环境变量模板为 .env,再编辑填入 HuggingFace / OpenRouter 的 token 与 API key,脚本会自动加载。

    cp .env.example .env
  6. 6运行训练或评测

    在仓库根目录、环境已激活的前提下执行训练/评测命令,具体命令各子项目 README 单独给出。

关键配置

配置项必填说明示例
.env是从 .env.example 复制而来,存放 HuggingFace、OpenRouter 等 token 与 API keycp .env.example .env

如何确认成功

uv sync 无报错、虚拟环境成功激活(命令行出现 .venv 标识),即环境就绪。

常见问题

Q:setup_env.sh 的两个参数分别代表什么?

A:第一个 sa2va 指项目名,第二个是环境类型;legacy 对应 InternVL2.5 或更早的骨干模型。

Q:uv sync 的 latest 和 legacy 怎么选?

A:使用最新骨干(如 Qwen3-VL、InternVL3)选 --extra=latest;使用 InternVL2.5 或更早版本选 --extra=legacy。

Q:为什么不用 pip install 装依赖?

A:项目用 uv 把依赖视为代码:pyproject.toml 声明、uv.lock 锁定全部传递依赖,一条 uv sync 即可精确复现。

Q:.env 里的密钥会被自动读取吗?

A:会,setup_env.sh 会自动加载根目录下的 .env 文件,因此只需复制模板并填写内容。

注意事项

  • 不要手动 pip install,依赖版本由 uv.lock 统一锁定,手动安装容易造成版本漂移
  • 激活环境后务必回到仓库根目录再执行训练/评测,各子项目还有自己的专属步骤
  • .env 含真实密钥,不要提交到代码仓库
  • latest 与 legacy 二选一,混用可能造成依赖冲突

核心亮点

  • 集成多种SOTA模型,覆盖图像/视频分割主流任务
  • 提供LSVOS冠军方案,实战验证效果强
  • 模块化设计,便于扩展和定制

不足之处

  • 依赖较多,环境配置可能复杂
  • 文档/社区待观察

适用场景

  • 学术研究:复现SOTA分割模型,对比实验
  • 视频编辑:自动分割视频中的目标对象
  • 自动驾驶:理解场景并分割动态物体

替代项目

SEEM、Grounded-SAM、VideoCutLER

项目介绍

Sa2VA 是计算机视觉领域的开源项目,由 bytedance 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,678)位列前 30%,在计算机视觉分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,656 增加到 1,678,净增 22。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署,无付费版本。

它主要面向的使用场景是:学术研究:复现SOTA分割模型,对比实验。同类可对比的替代方案包括 SEEM、Grounded-SAM、VideoCutLER。

上一篇:ha-llmvision

下一篇:PaDT

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14