VisionLLM 是开源模型领域的开源项目,由 OpenGVLab 开发,2023 年首次发布。
在全站 13,014 个收录项目中,它的 GitHub 星标数(1,153)位列前 30%,在开源模型分类中处于中上游。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署。
它主要面向的使用场景是:多模态对话助手,如基于图像的智能客服。同类可对比的替代方案包括 LLaVA、Qwen-VL、CogVLM。

让视觉模型听懂人话,直接对话图像内容
VisionLLM 是一个专注于视觉-语言大模型的开源系列项目,旨在弥合视觉理解与语言模型之间的鸿沟。它解决的核心问题是传统视觉模型难以直接与大型语言模型高效协同的问题,通过提供统一的模型架构和训练范式,使模型能够同时处理图像和文本输入,并生成文本输出。项目包含多个模型变体,如 VisionLLM-v2,支持视觉定位、视觉问答、图像描述等任务。其核心能力包括基于 Transformer 的视觉编码器、与 LLM 的对齐机制、以及多任务指令微调流程。项目提供了完整的训练和推理代码,以及预训练模型权重,方便研究者和开发者进行二次开发和应用部署。
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
1克隆官方仓库
从 GitHub 拉取 VisionLLM 源码,README 节选未提供其他获取方式,请保持仓库完整。
git clone https://github.com/OpenGVLab/VisionLLM.git2进入项目目录
切换工作目录到克隆下来的仓库根目录,后续操作都在该目录内进行。
cd VisionLLM3确认版本与论文
README 节选仅给出两篇论文与版本发布信息,请据此确认要使用 VisionLLM 还是 VisionLLM v2。
节选未给出启动命令,可确认仓库克隆完成、目录文件完整,并核对 README 中版本信息与目标一致。
Q:VisionLLM 和 VisionLLM v2 有什么区别?
A:VisionLLM(NIPS2023)把大语言模型作为开放式解码器处理视觉中心任务;VisionLLM v2(NIPS2024,2024/06 发布)是通用多模态大模型,支持数百种视觉-语言任务。
Q:VisionLLM v2 支持哪些任务?
A:覆盖视觉理解、感知与生成三大类,具体包括视觉定位、视觉问答、图像描述等数百种视觉-语言任务。
Q:README 里为什么没有安装步骤?
A:本次提供的只是 README 节选,内容以论文链接和 News 为主,安装与推理说明需查看仓库最新完整 README。
Q:可以直接下载预训练权重吗?
A:项目介绍提到提供预训练模型权重,但节选中未给出下载地址,请以官方仓库文档中的链接为准。
LLaVA、Qwen-VL、CogVLM
VisionLLM 是开源模型领域的开源项目,由 OpenGVLab 开发,2023 年首次发布。
在全站 13,014 个收录项目中,它的 GitHub 星标数(1,153)位列前 30%,在开源模型分类中处于中上游。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署。
它主要面向的使用场景是:多模态对话助手,如基于图像的智能客服。同类可对比的替代方案包括 LLaVA、Qwen-VL、CogVLM。
Machine-Learning
开源
跟着博客笔记,边看边跑机器学习代码
All content related to machine learning from my blog
awesome-claude-fable-5-prompt-va···
开源
一站式掌握 Claude Fable 5 玩法,快速选型不踩坑
Ultimate Claude Fable 5 Guide 2026: Use Cases, Integrations & Benchmarks
Diffusion-Models-Papers-Survey-T···
开源
学视频生成怕绕路?这份资料库帮你理清
Diffusion model papers, survey, and taxonomy
CoreML-Models
开源
下载即用的苹果端 AI 模型库,免去转换烦恼
Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···