LLaVA

拍张图丢给 AI,它看得懂还能聊出细节

视觉指令微调(Visual Instruction Tuning)的开创性工作,NeurIPS 2023 Oral 论文。通过指令微调赋予视觉语言模型 GPT-4V 级别的多模态理解能力,是视觉对话与多模态 AI 领域的重要里程碑。

开源 unknown 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 25035
维护状态 低维护
是否开源
定价模式 unknown

项目数据

分类对话助手
开发团队haotian-liu
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型chatbot,chatgpt,foundation-models,gpt-4,instruction-tuning,llama,llama-2,llama2,llava,multi-modality,multimodal,vision-language-model,visual-language-learning
GitHub 星标★ 25035
30天Star增速
HF 下载量
上线时间2023-04-17 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 25 分钟 部署方式:本地安装 7 步

环境要求

  • Linux 系统(README 明确说明非 Linux 请勿继续,macOS/Windows 需另见官方文档)
  • 已安装 conda 环境管理工具
  • Python 3.10(conda 环境按此版本创建)
  • git(用于克隆仓库)
  • 如需安装 flash-attn,需要可用的 CUDA 环境

安装与启动步骤

  1. 1克隆项目仓库

    从 GitHub 克隆 LLaVA 源码并进入项目目录,后续所有命令都在 LLaVA 目录内执行。

    git clone https://github.com/haotian-liu/LLaVA.git
    cd LLaVA
  2. 2创建 conda 环境

    按 README 用 Python 3.10 新建名为 llava 的独立环境,避免污染系统 Python。

    conda create -n llava python=3.10 -y
  3. 3激活环境升级 pip

    激活 llava 环境并升级 pip,以便支持 PEP 660 的可编辑安装方式。

    conda activate llava
    pip install --upgrade pip
  4. 4安装 LLaVA 包

    以可编辑模式安装项目本体,之后才能 import llava 包并加载模型。

    pip install -e .
  5. 5安装训练依赖

    README 指明训练场景需额外安装 train 附加依赖,仅推理可跳过此步。

    pip install -e ".[train]"
  6. 6安装 flash-attn

    训练/加速推理需安装 flash-attn,必须带 --no-build-isolation 参数。

    pip install flash-attn --no-build-isolation
  7. 7运行快速示例

    用 README 的 HuggingFace 示例加载 7B 模型并让模型描述一张图片。首次运行会自动下载权重。

    from llava.model.builder import load_pretrained_model
    from llava.mm_utils import get_model_name_from_path
    from llava.eval.run_llava import eval_model
    
    model_path = "liuhaotian/llava-v1.5-7b"
    prompt = "What are the things I should be cautious about when I visit here?"
    image_file = "https://llava-vl.github.io/static/images/view.jpg"
    
    args = type('Args', (), {
        "model_path": model_path,
        "model_base": None,
        "model_name": get_model_name_from_path(model_path),
        "query": prompt,
        "conv_mode": None,
        "image_file": image_file,
        "sep": ",",
        "temperature": 0,
        "top_p": None,
        "num_beams": 1,
        "max_new_tokens": 512
    })()
    
    eval_model(args)

关键配置

配置项必填说明示例
model_path模型权重路径或 HuggingFace 仓库名liuhaotian/llava-v1.5-7b
model_baseLoRA 权重对应的基础模型路径,非 LoRA 可为 NoneNone
image_file要询问的图片路径或图片 URLhttps://llava-vl.github.io/static/images/view.jpg
query向模型提出的问题文本What are the things I should be cautious about when I visit
temperature采样温度,0 表示确定性输出0
max_new_tokens生成回答的最大 token 数512

如何确认成功

运行 eval_model 示例后能正常打印出模型对图片的回答文本,且过程中无导入报错。

常见问题

Q:我不是 Linux 系统能装吗?

A:README 明确说非 Linux 不要按本文档继续,macOS 和 Windows 用户需查看仓库 docs/macOS.md 与 docs/Windows.md 的专用说明。

Q:flash-attn 安装失败怎么办?

A:README 建议尝试加缓存禁用参数重装:pip install flash-attn --no-build-isolation --no-cache-dir。

Q:只想快速体验不想本地部署?

A:可使用官方 Demo 网页 llava.hliu.cc,或社区提供的 HuggingFace Space、Replicate、Colab 等在线方式。

Q:模型权重需要自己训练吗?

A:不需要,示例直接加载 HuggingFace 上的 liuhaotian/llava-v1.5-7b,首次运行会自动下载。

注意事项

  • README 只保证 Linux 安装流程,其他系统请走官方 macOS/Windows 文档。
  • pip install -e ".[train]" 与 flash-attn 属于训练相关依赖,纯推理可暂不安装。
  • 首次加载模型会从 HuggingFace 下载数 GB 权重,请确保磁盘与网络充足。
  • 示例中的图片使用在线 URL,本地图片可替换为文件路径。

核心亮点

  • 首个将视觉指令微调与GPT-4生成的多模态对话数据结合的框架,开创性提出LLaVA架构,在NeurIPS 2023获得Oral,学术影响力大
  • 模型能力接近GPT-4V,支持图像+文本混合输入,在视觉问答、图像描述等任务上表现优异,且推理成本较低
  • 代码结构清晰,基于HuggingFace生态,提供完整的训练、微调与推理脚本,便于二次开发和定制

不足之处

  • 训练依赖大量人工标注或GPT-4生成的数据,数据获取成本高,且模型对复杂场景的鲁棒性有限
  • 文档/社区待观察

适用场景

  • 多模态对话助手,如智能客服、教育辅导中结合图像理解
  • 视觉问答系统,用于医疗影像、工业质检等领域的辅助分析
  • 多模态内容生成,如根据图片生成描述、故事或报告

替代项目

BLIP-2、MiniGPT-4、InstructBLIP

项目介绍

LLaVA 是开源模型领域的开源项目,由 haotian-liu 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(25,035)位列前 2%,在开源模型分类的 422 个项目里位列前 1%。

近 44 天,它的 GitHub 星标从 24,974 增加到 25,035,净增 61。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。从国内网络环境看,当前已无法正常访问。

它主要面向的使用场景是:多模态对话助手,如智能客服、教育辅导中结合图像理解。同类可对比的替代方案包括 BLIP-2、MiniGPT-4、InstructBLIP。

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10