LLaVA-Mini

一个模型搞定图像视频理解,又快又省资源

LLaVA-Mini 是一个统一的大规模多模态模型(LMM),旨在高效处理图像、高分辨率图像和视频的理解任务。它解决了传统多模态模型在处理高分辨率图像和视频时计算成本高、推理速度慢的问题,通过紧凑的架构和优化的注意力机制,在保持性能的同时显著提升效率。核心能力包括:支持多种视觉输入类型(普通图像、高分辨率图像、视频),统一模型架构无需切换不同模型,以及高效的推理速度,适合实时或资源受限的应用场景。作为早期项目,它展示了多模态模型轻量化的潜力,为边缘设备部署和实时视觉理解提供了新思路。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 576
维护状态 低维护
是否开源
定价模式 free

项目数据

分类开源模型
开发团队ictnlp
所属国家
官网地址
定价模式free
价格说明开源模型,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型efficient,gpt4o,gpt4v,large-language-models,large-multimodal-models,llama,llava,multimodal,multimodal-large-language-models,video,vision,vision-language-model,visual-instruction-tuning
GitHub 星标★ 576
30天Star增速
HF 下载量
上线时间2025-01-07 00:00:00
最近更新2026-09-19 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 统一架构同时处理图像、高分辨率图像和视频,无需多个模型切换
  • 高效推理设计,降低计算开销,适合实时应用
  • 基于LLaVA生态,易于集成和扩展

不足之处

  • 早期项目,文档和社区支持待观察
  • 模型精度可能不如更大规模的多模态模型

适用场景

  • 边缘设备上的实时视觉问答
  • 高分辨率图像内容理解(如医疗影像、卫星图)
  • 视频摘要和事件检测

替代项目

LLaVA、Qwen-VL、InternVL

项目介绍

LLaVA-Mini 是开源模型领域的开源项目,由 ictnlp 开发,2025 年首次发布。

它收录于开源模型分类,该分类目前共有 422 个项目,GitHub 星标数为 576。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-19。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:边缘设备上的实时视觉问答。同类可对比的替代方案包括 LLaVA、Qwen-VL、InternVL。

上一篇:Attention-Sink

下一篇:buffer-of-thought-llm

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10