multi-modality

本站收录 18 个带「multi-modality」标签的 AI 开源项目

LLaVA视觉指令微调(Visual Instruction Tuning)的开创性工作,NeurIPS 2023 Oral 论文。通过指令微调赋予视觉语言模型 GPT-★ 25,045Awesome-Multimodal-Large-Language-Models这是一个持续更新的多模态大语言模型(MLLM)资源清单,汇总了领域内最新进展,包括论文、模型、数据集和工具。项目按模型架构、任务类型和应用场景分类整理,覆盖从视★ 18,040MOSS-TTS-NanoMOSS-TTS-Nano 是 MOSI.AI 与 OpenMOSS 团队开源的多语言轻量级语音合成模型,参数量仅 0.1B,专为实时语音生成设计。它解决了传统★ 4,428deep-dazedeep-daze 是一个基于 OpenAI CLIP 和 Siren 隐式神经表示网络的命令行工具,用于将文本描述转化为图像。它解决了文本到图像生成中语义对齐★ 4,314OtterOtter是一个基于OpenFlamingo的多模态模型,旨在提升视觉-语言任务的指令跟随和上下文学习能力。它针对DeepMind Flamingo的开源版本进★ 3,443InternLM-XComposerInternLM-XComposer 是上海人工智能实验室推出的多模态大模型系统,最新版本 2.5-OmniLive 专注于长时流式视频与音频的实时交互。它解决★ 2,928VisRAGVisRAG 是一个基于视觉语言模型(VLM)的解析免检索增强生成(RAG)框架。传统 RAG 依赖文本解析(如 PDF 转文本),而 VisRAG 直接将文档★ 981Long-RLLong-RL 是一个针对长序列强化学习(RL)训练的开源项目,由 NeurIPS 2025 论文支撑,旨在解决 RL 在长上下文场景下训练不稳定、内存开销大等★ 729Multi-Modality-ArenaMulti-Modality-Arena 是一个基于 Gradio 构建的多模态模型评测平台,灵感来自 Chatbot Arena,但专注于视觉-语言模型(VL★ 566MM-DiffusionMM-Diffusion是CVPR 2023提出的多模态扩散模型,用于联合生成音频和视频。它解决的是传统生成模型只能处理单一模态、难以实现音视频同步生成的问题。★ 453Collaborative-DiffusionCollaborative Diffusion 是一个面向多模态条件引导的扩散模型框架,核心解决现有扩散模型难以同时利用多种异构条件(如文本、草图、语义图、参考★ 443Open-LLaVA-NeXTOpen-LLaVA-NeXT 是一个开源实现,旨在复现和训练 LLaVA-NeXT 多模态大模型。它解决了社区中缺乏完整、可复现的 LLaVA-NeXT 训练★ 440OlympusOlympus 是一个面向计算机视觉任务的通用任务路由器,由 CVPR 2025 Highlight 论文官方开源。它旨在解决多模态大模型(如 LLaVA)在处★ 427RLHF-VRLHF-V 是一个面向多模态大语言模型(MLLMs)的可信行为对齐框架,核心解决模型在视觉对话中产生幻觉(如描述不存在的物体)的问题。它通过收集细粒度的修正性★ 311MGM-OmniMGM-Omni 是一个面向个性化长时语音交互的多模态大语言模型(Omni LLM)开源项目。它解决的是现有语音大模型在长时间对话中缺乏个性化、语音与文本模态对★ 203Awesome-VLAAwesome-VLA 是一个精选列表,汇总了视觉-语言-动作(VLA)模型的最新进展。VLA 模型结合视觉、语言和动作,使机器人能够理解自然语言指令并执行相应★ 128CausalMMCausalMM 是一个针对多模态大语言模型(MLLM)幻觉问题的开源项目,发表于 ICLR 2025。它主要解决因模态先验(如文本先验)导致的幻觉,即模型在生★ 67LORISLORIS 是一个基于 ICML 2023 论文的长期节奏视频配乐工具,专门解决为长视频自动生成与画面节奏同步的背景音乐的问题。它通过分析视频中的运动节奏(如剪★ 64