multimodal-large-language-models

本站收录 58 个带「multimodal-large-language-models」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

Awesome-Multimodal-Large-Language-Models这是一个持续更新的多模态大语言模型(MLLM)资源清单,汇总了领域内最新进展,包括论文、模型、数据集和工具。项目按模型架构、任务类型和应用场景分类整理,覆盖从视★ 18,040star-vectorStarVector 是一个用于 SVG 生成的基础模型,它将矢量图转换任务重构为代码生成任务。基于视觉-语言建模架构,StarVector 能同时处理图像和文★ 4,611BayLing-SpeechBayLing-Speech(即LLaMA-Omni)是一个基于Llama-3.1-8B-Instruct构建的端到端语音交互模型,旨在实现GPT-4o级别的语★ 3,146VideoPipeVideoPipe 是一个基于计算机视觉模型和多模态大语言模型(mLLM)的跨平台视频结构化分析框架。它解决的是视频数据从原始帧到结构化信息的端到端处理问题,将★ 2,962cambrianCambrian-1 是一个以视觉为中心设计的开源多模态大语言模型(MLLM)家族。它解决的是当前多模态模型在视觉感知能力上受限的问题,强调通过视觉中心的设计来★ 2,011RPG-DiffusionMasterRPG-DiffusionMaster 是一个基于多模态大语言模型(MLLM)的文本到图像生成与编辑框架,发表于 ICML 2024。它解决传统扩散模型在复杂提★ 1,842OvisOvis是一个多模态大语言模型(MLLM)架构,旨在从结构上对齐视觉和文本嵌入。它解决了传统多模态模型在融合视觉与语言信息时存在的语义鸿沟问题,通过创新的嵌入对★ 1,525VideoChatVideoChat 是一个基于 Python 的实时交互数字人开源项目,旨在解决传统数字人开发门槛高、交互延迟大的问题。它允许用户自定义数字人的形象和音色,并支★ 1,313awesome-multimodal-in-medical-imaging这是一个关于医学影像中多模态学习应用资源的精选列表,收录了论文、数据集、代码和工具,覆盖多模态融合、跨模态生成、医学视觉语言模型等方向。它解决了医学影像领域多模★ 982NEONEO 是一个从第一性原理出发构建的原生视觉-语言模型系列,旨在解决当前多模态模型依赖外部视觉编码器、架构复杂且训练不透明的问题。项目强调端到端的原生多模态理解★ 896Video-MMEVideo-MME 是首个专门用于评估多模态大语言模型(LLMs)在视频分析任务中表现的综合基准测试集,发表于 CVPR 2025。它旨在解决现有视频理解基准在★ 798MovieChatMovieChat 是一个面向长视频理解的开源模型,由 CVPR 2024 论文提出。它解决了现有视频理解模型难以处理超长视频(如电影)的问题,核心创新在于将视★ 707unicomunicom 是一个大规模视觉表示模型,旨在通过自监督或弱监督学习从海量图像数据中提取通用视觉特征。它解决了传统视觉模型在跨领域泛化能力不足的问题,通过在大规模★ 702OmniVinciOmniVinci 是一个全模态大语言模型,旨在联合理解视觉、音频和语言信息。它解决的是传统多模态模型往往只支持文本与图像,而难以同时处理音频、视频等多种模态数★ 683WoodpeckerWoodpecker 是一个针对多模态大语言模型(MLLM)的幻觉纠正工具。它通过训练一个轻量级的纠正器,在模型生成文本后,利用视觉知识库和交叉验证机制,自动检★ 650LiquidLiquid 是一个基于大型语言模型的可扩展统一多模态生成框架,已被 IJCV 接收。它旨在解决传统扩散模型在图像生成中步骤多、速度慢,且难以与语言模型统一的问★ 640LLaVA-MiniLLaVA-Mini 是一个统一的大规模多模态模型(LMM),旨在高效处理图像、高分辨率图像和视频的理解任务。它解决了传统多模态模型在处理高分辨率图像和视频时计★ 576Awesome-LLMs-meet-Multimodal-Generation这是一个精选论文列表,聚焦于基于大语言模型(LLM)的多模态生成领域,涵盖图像、视频、3D和音频四大模态。项目系统梳理了LLM与多模态生成结合的前沿研究,包括多★ 552awesome-vla-for-ad这是一个聚焦视觉-语言-动作模型(VLA)在自动驾驶领域应用的精选资源列表,系统梳理了该方向从过去到未来的研究脉络。项目解决了自动驾驶领域研究者难以快速获取VL★ 483Ovis-U1Ovis-U1 是一个统一的多模态大语言模型框架,将视觉理解、文生图和图像编辑能力整合到单一模型中。它解决了传统上需要分别部署多个专用模型(如理解模型、生成模型★ 453Awesome_Matching_Pretraining_Transfering这是一个精选论文列表项目,收录了大型多模态模型(LMM)在感知、生成、统一方面的前沿研究,同时覆盖参数高效微调(PEFT)、视觉-语言预训练(VLP)以及传统图★ 446Freeze-OmniFreeze-Omni 是一个智能且低延迟的语音到语音对话模型,其核心创新在于冻结大语言模型(LLM)参数,仅训练语音编码器和解码器,从而大幅降低训练成本并保持★ 400Awesome-Medical-Large-Language-ModelsAwesome-Medical-Large-Language-Models 是一个精选医疗大语言模型论文的列表项目,旨在系统整理医疗健康领域大语言模型(LLM)★ 391EVEEVE是北京智源人工智能研究院(BAAI)推出的免编码器视觉语言模型系列。传统视觉语言模型通常依赖预训练的视觉编码器(如ViT)来提取图像特征,而EVE直接以像★ 376lmms-finetunelmms-finetune 是一个极简的多模态大模型微调代码库,旨在降低 LMM(Large Multimodal Model)微调的门槛。它支持多种主流模型,★ 376Video-MME-v2Video-MME-v2 是一个面向全面视频理解的新一代评测基准项目。它旨在解决现有视频理解基准在任务多样性、视频长度覆盖和评估维度上的不足,推动视频大模型从简★ 370Awesome-LVLM-Hallucination这是一个持续更新的精选列表,汇总了大型视觉语言模型(LVLM)幻觉研究的最新论文、资源和相关工作。它旨在解决LVLM在生成文本时可能产生与图像内容不符的幻觉信息★ 332LLMVoXLLMVoX 是一个将任意大型语言模型(LLM)转换为支持流式语音对话的端到端系统。它解决了传统语音助手需要额外语音识别和合成模块、延迟高且交互不自然的问题。核★ 312Awesome-Multimodal-LLM-Autonomous-Driving这是一个聚焦多模态大语言模型(MLLM)在自动驾驶领域应用的精选资源列表,源自WACV 2024综述论文。项目系统梳理了该交叉方向的研究进展,包括数据集、模型架★ 311ml-slowfast-llavaSlowFast-LLaVA 是一个面向视频理解的多模态大语言模型方案,核心卖点是无需额外训练即可直接使用。它针对视频问答(Video QA)任务中现有模型普遍★ 294u2Tokenizeru2Tokenizer 是一个面向放射学报告生成(RRG)任务的多尺度多模态大语言模型开源项目。它要解决的问题是:传统放射报告生成模型通常只处理单一尺度图像特征★ 282Awesome-Multimodal-LLM-for-Code这是一个面向多模态代码生成研究的论文清单与资源汇总项目,对应 TMLR 2026 论文《Multimodal Large Language Models for★ 278FM-AD-SurveyFM-AD-Survey 是一个持续更新的综述论文仓库,专注于大型基础模型(Foundation Models)在自动驾驶场景生成与分析中的应用。它系统收集和整★ 238LLaVA-MoDLLaVA-MoD 是一个面向多模态大语言模型的高效压缩方案,通过结合混合专家(MoE)与知识蒸馏技术,将原本庞大的 LLaVA 模型压缩为轻量级版本,同时保持★ 227Awesome-Anomaly-Detection-Foundation-Models这是一个精选列表,汇集了基于基础模型(如大语言模型、视觉-语言模型、图基础模型、时间序列基础模型)进行异常检测的相关论文和资源。项目旨在为研究者和工程师提供一个★ 223Awesome-Video-Reasoning-Landscape这是一个关于视频推理领域的开源综述项目,旨在系统梳理视频推理的最新任务、范式和基准。它解决了视频理解领域缺乏统一知识框架的问题,帮助研究者和开发者快速了解视频推★ 191Awesome-Music-GenerationAwesome-Music-Generation 是一个聚焦音乐生成模型(MG²)的资源合集,收录了基于扩散模型、大语言模型等技术的音乐生成项目、论文和工具。它★ 167PaDTPaDT 是一个面向多模态大语言模型(MLLM)的统一视觉任务框架,其核心思想是将图像分割为可解码的视觉 token(Patch-as-Decodable-To★ 165DecoDeco 是一个针对多模态大语言模型(MLLM)的幻觉缓解工具,核心方法为动态校正解码(Dynamic Correction Decoding)。它解决了 ML★ 147OceanGymOceanGym 是一个面向水下具身智能体的基准测试环境,旨在解决水下机器人(如AUV、ROV)在复杂海洋环境中进行导航、操控和决策时缺乏标准化评估平台的问题。★ 146multimodal-chatmultimodal-chat 是一个基于 Python 和 Gradio 构建的多模态聊天界面,集成了多种工具,支持通过 Anthropic Claude 和★ 133VChainVChain是一个面向视频生成领域的推理增强框架,核心思想是引入“视觉思维链”(Chain-of-Visual-Thought),让视频生成模型在生成过程中显式★ 121DimpleDimple 是首个离散扩散多模态大语言模型(Discrete Diffusion MLLM),把文本生成从传统的自回归逐词预测改为离散扩散式的并行去噪生成。它★ 117OceanGPTOceanGPT(沧渊)是面向海洋科学任务的大语言模型,由ACL 2024论文提出。它解决通用大模型在海洋领域知识匮乏、专业任务理解不足的问题,通过领域指令微调★ 115MineLandMineLand 是一个基于 Minecraft 的大规模多智能体交互仿真框架,旨在研究智能体在有限多模态感知和物理需求下的行为协作。项目解决了现有仿真环境在规★ 113Awesome-AVIAwesome-AVI 是一个关于音频-视觉智能(Audio-Visual Intelligence)的精选资源列表,旨在系统梳理该领域的前沿研究、工具和数据集★ 90Awesome-Token-Merge-for-MLLMs这是一个关于多模态大语言模型(MLLMs)中Token合并、减少、重采样和丢弃技术的论文列表项目。它系统整理了该方向的前沿研究,帮助研究者和开发者快速了解如何通★ 90HoliTomHoliTom是一个针对视频大语言模型(Video LLM)的推理加速工具,核心思路是“整体令牌合并”(Holistic Token Merging)。视频模型★ 86Video-BenchVideo-Bench 是一个视频生成领域的评测基准项目,旨在系统评估视频生成模型的质量。它解决的核心问题是:当前视频生成模型(如Sora类模型)缺乏统一、客观★ 81HermesFlowHermesFlow 是一个多模态大语言模型(MLLM)项目,旨在弥合视觉理解与生成之间的鸿沟。它通过统一框架同时支持图像到文本(如描述、问答)和文本到图像(如★ 78