
LLaVA-pp
给 LLaVA 换上 LLaMA-3/Phi-3 大脑,看图对话更聪明
LLaVA++ 是在经典多模态模型 LLaVA 基础上做的扩展版本,核心思路是把 LLaVA 的视觉编码器与更强的语言模型 Phi-3、LLaMA-3 结合,从而让模型既能看图又能用更强的语言能力对话。它解决的是原版 LLaVA 语言底座偏弱、回答质量和推理能力有限的问题,通过替换 LLM 主干,提升图文问答、图像描述、视觉指令跟随等任务的表现。项目提供训练与推理代码,支持在自定义图文数据上微调,输出 LLaVA-LLaMA-3、LLaVA-Phi-3 等变体。适合想低成本复现多模态大模型、研究视觉指令微调、或在自有数据上做领域适配的开发者,是 LLaVA 生态中较早上手 LLaMA-3/Phi-3 视觉版的参考实现。
开源
free
开源模型
GitHub 星标
★ 842
维护状态
较活跃
是否开源
是
定价模式
free
项目数据
分类开源模型
开发团队mbzuai-oryx
所属国家
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型conversation,llama-3-llava,llama-3-vision,llama3,llama3-llava,llama3-vision,llava,llava-llama3,llava-phi3,llm,lmms,phi-3-llava,phi-3-vision,phi3,phi3-llava,phi3-vision,vision-language
GitHub 星标★ 842
30天Star增速
HF 下载量
上线时间2024-04-26 00:00:00
最近更新2026-09-05 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0
使用教程
核心亮点
- 把 LLaVA 视觉塔直接接到 LLaMA-3、Phi-3 上,提供可复现的训练与推理脚本
- 覆盖 LLaVA-LLaMA-3、LLaVA-Phi-3 多个变体,方便对比不同语言底座效果
- 基于成熟 LLaVA 代码结构,改动集中在 LLM 替换,二次开发和微调门槛低
不足之处
- 相比官方 LLaVA 与后续 LLaVA-1.5/NeXT,更新与维护活跃度有限
- 缺少大规模基准评测与详细消融,效果更多依赖社区复现
适用场景
- 在自有图文数据上微调出垂直领域视觉问答模型
- 研究不同语言底座对多模态指令跟随能力的影响
- 作为多模态大模型入门项目,快速跑通训练到推理全流程
替代项目
LLaVA、LLaVA-NeXT、Qwen-VL
项目介绍
同类项目推荐
awesome-claude-fable-5-prompt-va···
开源
一站式掌握 Claude Fable 5 玩法,快速选型不踩坑
Ultimate Claude Fable 5 Guide 2026: Use Cases, Integrations & Benchmarks
Machine-Learning
开源
跟着博客笔记,边看边跑机器学习代码
All content related to machine learning from my blog
Diffusion-Models-Papers-Survey-T···
开源
学视频生成怕绕路?这份资料库帮你理清
Diffusion model papers, survey, and taxonomy
CoreML-Models
开源
下载即用的苹果端 AI 模型库,免去转换烦恼
Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···