large-multimodal-models

本站收录 20 个带「large-multimodal-models」标签的 AI 开源项目

awesome-vlm-architectures这是一个精心整理的视觉语言模型(VLM/MLLM)架构目录,收录了155+个相关模型,涵盖论文、架构图、训练配方、数据集以及发布时间线。项目以可视化的方式呈现多★ 1,324ShareGPT4VideoShareGPT4Video 是一个由 NeurIPS 2024 收录的开源项目,旨在通过生成高质量的视频描述文本来提升视频理解与生成模型的性能。它解决了当前视★ 1,096awesome-multimodal-in-medical-imaging这是一个关于医学影像中多模态学习应用资源的精选列表,收录了论文、数据集、代码和工具,覆盖多模态融合、跨模态生成、医学视觉语言模型等方向。它解决了医学影像领域多模★ 982MMMUMMMU 是一个大规模多学科多模态理解与推理基准测试集,旨在评估和推动 AI 模型在专家级通用人工智能(AGI)方向上的能力。它包含来自艺术、工程、科学等六大领★ 597LLaVA-MiniLLaVA-Mini 是一个统一的大规模多模态模型(LMM),旨在高效处理图像、高分辨率图像和视频的理解任务。它解决了传统多模态模型在处理高分辨率图像和视频时计★ 576Open-LLaVA-NeXTOpen-LLaVA-NeXT 是一个开源实现,旨在复现和训练 LLaVA-NeXT 多模态大模型。它解决了社区中缺乏完整、可复现的 LLaVA-NeXT 训练★ 440OPERAOPERA是一个针对多模态大语言模型幻觉问题的开源工具,源自CVPR 2024 Highlight论文。它通过过度信任惩罚和回溯分配机制,有效缓解模型在生成文本★ 414Stream-OmniStream-Omni 是一个类似 GPT-4o 的多模态对话助手,能够同时处理文本、语音和视觉输入,并支持多种模态组合的交互。它解决了传统对话系统只能处理单一★ 392lmms-finetunelmms-finetune 是一个极简的多模态大模型微调代码库,旨在降低 LMM(Large Multimodal Model)微调的门槛。它支持多种主流模型,★ 376MixEvalMixEval 是一个大语言模型评估套件,提供动态更新的评测数据集和标准化评估流程。它解决传统静态基准测试因数据泄露和过拟合导致模型分数虚高的问题,通过混合多种★ 254GenAI4ADGenAI4AD 是一个系统梳理生成式人工智能(GenAI)在自动驾驶全栈中应用的开源项目。它并非一个可直接运行的模型,而是一份深度综述与知识图谱,覆盖从感知、★ 233Awesome-LMMs-Mechanistic-Interpretability这是一个聚焦大型多模态模型(LMMs)机制可解释性(MI)的资源精选仓库,专门收集与LMMs内部工作机制相关的研究论文、综述和博客文章。它解决了多模态模型(如视★ 220MMStarMMStar 是一个用于评估大型视觉语言模型(LVLMs)的基准测试工具,源自 NeurIPS 2024 论文。它解决了现有评估基准中模型可能通过语言先验或训练★ 217GeoPixelGeoPixel 是一个面向高分辨率遥感影像分析的像素级定位多模态大模型。它解决的是遥感图像中多目标精细定位与理解的问题,能够对图像中的多个目标进行像素级的分割★ 155YoChameleonYoChameleon 是一个 CVPR 2025 开源项目,旨在实现个性化图像生成中的身份保持与编辑。它解决的是在文本到图像生成模型中,如何将特定人物(或物体★ 151EarthDialEarthDial 是一个面向地球观测的多模态对话模型,由 CVPR 2025 论文提出。它旨在将卫星、航空等多传感器地球观测数据转化为交互式对话,让用户通过自★ 147Modality-Integration-RateModality-Integration-Rate 是 ICCV 2025 论文的官方代码,提出了一种名为“模态整合率”(Modality Integratio★ 114VisualWebBenchVisualWebBench 是一个针对多模态大语言模型(MLLMs)在网页理解与定位(Grounding)任务上的评估框架,源自同名论文。它解决的核心问题是:★ 68awesome-personalized-lmms这是一个精选资源列表,汇集了关于个性化大型多模态模型(Personalized Large Multimodal Models)的论文、代码和数据集。它解决的是★ 60PhyXPhyX 是一个专注于物理推理能力评估的开源基准测试项目,旨在回答“你的模型是否具备物理推理的‘智慧’”。它通过设计一系列需要物理常识和因果推断的任务,来测试大★ 55