vision-language
本站收录 14 个带「vision-language」标签的 AI 开源项目
Qwen-VL-Series-Finetune这是阿里云 Qwen-VL 系列多模态大模型的开源微调实现,面向需要让视觉语言模型适配自有数据的开发者。项目支持 Qwen2-VL、Qwen2.5-VL、Qwe★ 1,972
Video-ChatGPTVideo-ChatGPT 是一个面向视频对话的多模态大模型,发表于 ACL 2024。它结合了大型语言模型(如 Vicuna、LLaMA)与预训练视觉编码器(★ 1,512
awesome-japanese-llm这是一个专门汇总日本语大语言模型(LLM)资源的精选清单项目,旨在解决日语NLP领域模型分散、信息难找的问题。它系统整理了各类支持日语的LLM,包括开源模型、商★ 1,433
DriveLMDriveLM 是一个面向自动驾驶的视觉问答(VQA)基准与数据集,源自 ECCV 2024 Oral 论文。它提出用图结构组织驾驶场景中的视觉问答,将感知、预★ 1,347
ONE-PEACEONE-PEACE 是一个跨视觉、音频、语言三种模态的通用表示模型,旨在探索一种能处理无限模态的统一表征框架。它解决了传统模型只能处理单一或少数模态、难以共享和★ 1,060
LLaVA-ppLLaVA++ 是在经典多模态模型 LLaVA 基础上做的扩展版本,核心思路是把 LLaVA 的视觉编码器与更强的语言模型 Phi-3、LLaMA-3 结合,从★ 842
awesome-vla-for-ad这是一个聚焦视觉-语言-动作模型(VLA)在自动驾驶领域应用的精选资源列表,系统梳理了该方向从过去到未来的研究脉络。项目解决了自动驾驶领域研究者难以快速获取VL★ 483
World-SimulatorWorld-Simulator 是一个围绕“模拟真实世界”主题的学术资源聚合项目,收录了 IEEE TPAMI 2026 论文《Simulating the R★ 391
lmms-finetunelmms-finetune 是一个极简的多模态大模型微调代码库,旨在降低 LMM(Large Multimodal Model)微调的门槛。它支持多种主流模型,★ 376
ViP-LLaVAViP-LLaVA是CVPR 2024收录的多模态大模型,旨在让模型理解任意视觉提示(如点、框、涂鸦等),而不仅限于文本指令。它解决了现有视觉语言模型只能处理全★ 338
VideoGPT-plusVideoGPT-plus 是论文《VideoGPT+: Integrating Image and Video Encoders for Enhanced V★ 294
Awesome-RS-SpatioTemporal-VLMs这是一个关于遥感时空视觉语言模型(SpatioTemporal Vision-Language Models)的综述性开源项目,对应IEEE GRSM 2025★ 226
Text2EarthText2Earth 是一个面向遥感领域的文本生成图像开源项目,由 IEEE GRSM 2025 论文提出。它旨在解决遥感图像生成中数据稀缺和文本描述不足的问题★ 192
Shot2StoryShot2Story 是一个面向多镜头视频理解的新基准数据集和评测工具。它解决了现有视频理解基准仅提供单一全局描述、缺乏细粒度镜头级信息的问题,提供了包含完整视★ 181