LISA

让大模型看懂指令,直接分割出你想要的物体

LISA 是一个基于大型语言模型(LLM)的推理分割(Reasoning Segmentation)项目。它解决的是传统图像分割任务中,用户需要明确指定目标类别或区域,而无法理解复杂语言指令的问题。LISA 将多模态大模型(如 LLaVA)与分割模型(如 SAM)结合,使模型能够根据包含复杂推理的文本指令(例如“请分割出图中会导致交通事故的物体”)直接生成对应的分割掩码。其核心能力包括:处理隐式指代、多轮对话中的指代消解、以及基于世界知识的推理分割。项目提供了模型代码、训练/推理脚本和演示页面,支持在自定义数据上微调。LISA 在多个基准上展示了优于现有方法的效果,推动了视觉-语言模型在像素级理解任务上的发展。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2683
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队JIA-Lab-research
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可自由使用,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型large-language-model,llm,multi-modal,segmentation
GitHub 星标★ 2683
30天Star增速
HF 下载量
上线时间2023-08-01 00:00:00
最近更新2026-09-20 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 5 步

环境要求

  • 已安装 Python 环境,可执行 pip 命令
  • 带有 CUDA 的 NVIDIA GPU(flash-attn 需编译,部署命令使用 CUDA_VISIBLE_DEVICES)
  • 能访问 Hugging Face 下载 LISA 模型权重(如 xinlai/LISA-13B-llama2-v1)
  • 已获取 LISA 项目源码目录

安装与启动步骤

  1. 1获取项目源码

    克隆 LISA 仓库到本地并进入项目目录,后续安装与启动命令都在该目录下执行。

    git clone https://github.com/JIA-Lab-research/LISA
    cd LISA
  2. 2安装基础依赖

    在项目根目录用 requirements.txt 一次性安装 Python 依赖,建议使用虚拟环境或 conda 环境隔离。

    pip install -r requirements.txt
  3. 3安装 flash-attn

    必须加 --no-build-isolation,否则编译可能失败;该步骤耗时较长,需提前装好 CUDA 工具链。

    pip install flash-attn --no-build-isolation
  4. 4启动本地部署

    指定单张 GPU 运行 app.py,按 README 使用 4-bit 量化加载 13B 模型,首次运行会下载权重。

    CUDA_VISIBLE_DEVICES=0 python app.py --version='xinlai/LISA-13B-llama2-v1' --load_in_4bit
  5. 5启动解释版模型

    若要使用带解释输出的版本,把 --version 换成 explanatory 模型名,其余参数保持一致。

    CUDA_VISIBLE_DEVICES=0 python app.py --version='xinlai/LISA-13B-llama2-v1-explanatory' --load_in_4bit

关键配置

配置项必填说明示例
--version是指定要加载的 LISA 模型名称,决定使用哪个权重版本xinlai/LISA-13B-llama2-v1
--load_in_4bit否启用 4-bit 量化加载,README 中的默认推理方式--load_in_4bit
--load_in_8bit否替换 4-bit 参数,改为 8-bit 量化推理--load_in_8bit
CUDA_VISIBLE_DEVICES否环境变量,指定使用哪块 GPU 运行程序0

如何确认成功

终端无报错且模型权重下载加载完成后,app.py 会输出本地访问地址,浏览器打开该地址即可看到演示页面并进行分割推理。

常见问题

Q:16-bit 或 8-bit 推理怎么设置?

A:README 说明默认使用 4-bit 量化。删除 --load_in_4bit 参数即为 16-bit 推理,或将其替换为 --load_in_8bit 使用 8-bit 推理,显存需求会相应提高。

Q:两个 --version 模型有什么区别?

A:README 给出两个可选项:xinlai/LISA-13B-llama2-v1 为常规版本,xinlai/LISA-13B-llama2-v1-explanatory 为带解释输出的版本,按需选择其一启动即可。

Q:flash-attn 安装失败怎么办?

A:务必按 README 使用 pip install flash-attn --no-build-isolation,并确认本机 CUDA 环境与 PyTorch 版本匹配,否则编译会中断。

Q:可以用多张显卡吗?

A:README 的部署命令只演示了 CUDA_VISIBLE_DEVICES=0 单卡方式,未提供多卡部署说明,需要多卡请自行查阅仓库 issue。

注意事项

  • README 部署示例中 --version='xinlai/LISA-13B-llama2-v1 缺少右侧引号,实际执行时需补全为 'xinlai/LISA-13B-llama2-v1',否则命令解析会出错。
  • flash-attn 需要通过 CUDA 现场编译,安装时间较长且对 CUDA/PyTorch 版本敏感,建议在干净环境中安装。
  • 默认 4-bit 量化是为了降低 13B 模型的显存占用,删除该参数做 16-bit 推理会显著增加显存需求。
  • README 还提供了 Training、Dataset、LISA++ 模型与数据集等章节入口,微调与数据准备请对照原仓库文档操作。

核心亮点

  • 首创推理分割任务,将复杂语言推理与像素级分割结合
  • 基于 LLaVA 和 SAM 的强强联合,性能领先
  • 支持多轮对话和指代消解,交互自然

不足之处

  • 推理分割依赖大模型,计算资源要求高
  • 训练数据构建复杂,需人工标注推理式指令
  • 文档/社区待观察

适用场景

  • 智能助手根据自然语言指令编辑图像
  • 自动驾驶场景理解复杂路况并分割目标
  • 医疗影像中根据描述性文本分割病灶

替代项目

Grounded-SAM、SEEM、X-Decoder

项目介绍

LISA 是计算机视觉领域的开源项目,由 JIA-Lab-research 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,683)位列前 30%,在计算机视觉分类的 447 个项目里位列前 15%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-20。Apache-2.0许可证,可自由使用,无付费版本。

它主要面向的使用场景是:智能助手根据自然语言指令编辑图像。同类可对比的替代方案包括 Grounded-SAM、SEEM、X-Decoder。

上一篇:VideoPipe

下一篇:claude-real-video

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14