large-vision-language-models
本站收录 21 个带「large-vision-language-models」标签的 AI 开源项目
Awesome-Multimodal-Large-Language-Models这是一个持续更新的多模态大语言模型(MLLM)资源清单,汇总了领域内最新进展,包括论文、模型、数据集和工具。项目按模型架构、任务类型和应用场景分类整理,覆盖从视★ 18,040
ShareGPT4VideoShareGPT4Video 是一个由 NeurIPS 2024 收录的开源项目,旨在通过生成高质量的视频描述文本来提升视频理解与生成模型的性能。它解决了当前视★ 1,096
DoRADoRA(权重分解低秩适配)是ICML 2024口头报告论文的官方PyTorch实现,一种参数高效微调方法。它通过将预训练权重分解为幅度和方向两个分量,并对方向★ 1,000
Video-MMEVideo-MME 是首个专门用于评估多模态大语言模型(LLMs)在视频分析任务中表现的综合基准测试集,发表于 CVPR 2025。它旨在解决现有视频理解基准在★ 798
Awesome-LLMs-meet-Multimodal-Generation这是一个精选论文列表,聚焦于基于大语言模型(LLM)的多模态生成领域,涵盖图像、视频、3D和音频四大模态。项目系统梳理了LLM与多模态生成结合的前沿研究,包括多★ 552
Awesome_Matching_Pretraining_Transfering这是一个精选论文列表项目,收录了大型多模态模型(LMM)在感知、生成、统一方面的前沿研究,同时覆盖参数高效微调(PEFT)、视觉-语言预训练(VLP)以及传统图★ 446
Awesome-Medical-Large-Language-ModelsAwesome-Medical-Large-Language-Models 是一个精选医疗大语言模型论文的列表项目,旨在系统整理医疗健康领域大语言模型(LLM)★ 391
Video-MME-v2Video-MME-v2 是一个面向全面视频理解的新一代评测基准项目。它旨在解决现有视频理解基准在任务多样性、视频长度覆盖和评估维度上的不足,推动视频大模型从简★ 370
HallusionBenchHallusionBench 是一个针对多模态大语言模型(如 GPT-4V、LLaVA-1.5)的图像上下文推理基准测试集,旨在揭示模型在视觉问答中因视觉错觉或★ 343
Awesome-LVLM-Hallucination这是一个持续更新的精选列表,汇总了大型视觉语言模型(LVLM)幻觉研究的最新论文、资源和相关工作。它旨在解决LVLM在生成文本时可能产生与图像内容不符的幻觉信息★ 332
Awesome-LMMs-Mechanistic-Interpretability这是一个聚焦大型多模态模型(LMMs)机制可解释性(MI)的资源精选仓库,专门收集与LMMs内部工作机制相关的研究论文、综述和博客文章。它解决了多模态模型(如视★ 220
MMStarMMStar 是一个用于评估大型视觉语言模型(LVLMs)的基准测试工具,源自 NeurIPS 2024 论文。它解决了现有评估基准中模型可能通过语言先验或训练★ 217
EarthDialEarthDial 是一个面向地球观测的多模态对话模型,由 CVPR 2025 论文提出。它旨在将卫星、航空等多传感器地球观测数据转化为交互式对话,让用户通过自★ 147
Spatial-SSRLSpatial-SSRL 是一个面向视觉语言模型(VLM)的自我监督强化学习框架,旨在提升模型的空间理解能力。它通过引入强化学习机制,让模型在无需人工标注的情况★ 141
talk2bevTalk2BEV 是一个面向自动驾驶场景的语言增强型鸟瞰图(BEV)地图开源项目,发表于 ICRA 2024。它解决了传统 BEV 感知结果难以被自然语言直接查★ 125
VLGuardVLGuard是一个针对视觉大语言模型(VLLMs)的安全微调基线项目,发表于ICML 2024。它解决的是VLLMs在视觉输入下容易生成不安全内容的问题,例如★ 91
Awesome-Mixture-of-Experts这是一个精选的混合专家(MoE)与混合多模态专家(MoME)资源列表,旨在为研究人员和工程师提供系统化的学习与参考入口。项目本身不包含代码实现,而是以目录形式收★ 75
Visual-ERMVisual-ERM 是一个用于视觉等价性奖励建模的开源项目,提供了论文《Visual-ERM: Reward Modeling for Visual Equi★ 67
CausalMMCausalMM 是一个针对多模态大语言模型(MLLM)幻觉问题的开源项目,发表于 ICLR 2025。它主要解决因模态先验(如文本先验)导致的幻觉,即模型在生★ 67
Awesome-MLLM-Uncertainty这是一个精选多模态大语言模型(MLLM)不确定性研究论文的列表项目,旨在系统梳理该领域的最新进展。它解决的是MLLM在推理过程中缺乏可靠置信度、容易产生幻觉或错★ 59