multimodal-learning
本站收录 19 个带「multimodal-learning」标签的 AI 开源项目
CoOpCoOp(Context Optimization)是一个针对视觉-语言模型(如CLIP)的提示学习(Prompt Learning)开源项目,由OpenAI团★ 2,231
awesome-multimodal-in-medical-imaging这是一个关于医学影像中多模态学习应用资源的精选列表,收录了论文、数据集、代码和工具,覆盖多模态融合、跨模态生成、医学视觉语言模型等方向。它解决了医学影像领域多模★ 982
MMMUMMMU 是一个大规模多学科多模态理解与推理基准测试集,旨在评估和推动 AI 模型在专家级通用人工智能(AGI)方向上的能力。它包含来自艺术、工程、科学等六大领★ 597
Multimodal-RAG-SurveyMultimodal-RAG-Survey 是一份关于多模态检索增强生成(RAG)的综述性开源项目,旨在系统梳理多模态RAG领域的研究进展、技术方法和未来方向。★ 545
ICASSP-2023-24-Papers这是一个汇集ICASSP 2023和2024会议论文的仓库,旨在为声学、语音和信号处理领域的研究者提供一站式的论文集合。项目解决了学术会议论文分散、难以系统追踪★ 525
GPT4PointGPT4Point 是一个面向3D点云与语言统一理解与生成的框架,来自CVPR 2024 Highlight。它解决的是3D点云数据与自然语言之间跨模态对齐的难★ 447
CLIPACLIPA是NeurIPS 2023论文的官方开源实现,核心发现是CLIP训练中存在逆缩放定律,即模型容量与数据规模可以按比例缩减而不损失性能。项目提供了高效训★ 323
stable-pretrainingstable-pretraining 是一个用于预训练基础模型和世界模型的 Python 库,主打可靠、极简和可扩展。它主要解决深度学习研究中预训练流程复杂、复★ 320
MMStarMMStar 是一个用于评估大型视觉语言模型(LVLMs)的基准测试工具,源自 NeurIPS 2024 论文。它解决了现有评估基准中模型可能通过语言先验或训练★ 217
MMVIDMMVID是一个基于多模态条件约束的视频生成开源项目,来自CVPR 2022论文。它解决的核心问题是:如何根据文本描述和参考图像,生成与内容语义一致、且具有合理★ 191
FrozenBiLMFrozenBiLM 是一个用于零样本视频问答(VideoQA)的开源模型,来自 NeurIPS 2022 论文。它解决的是在没有任何视频标注数据的情况下,直接★ 159
LLM-PuzzleTestLLM-PuzzleTest 是一个专注于多模态谜题推理的开源项目,主要发布用于评估和提升大语言模型(LLM)在多模态谜题场景下推理能力的数据集和模型。该项目针★ 119
UniMedVLUniMedVL 是一个面向医疗领域的统一视觉语言模型,旨在同时处理医学图像的理解与生成任务。它通过“观察-知识-分析”框架,将多模态理解(如图像分类、报告生成★ 109
Awesome-Multimodal-Reasoning这是一个精选多模态推理与生成前沿资源的列表,聚焦于基于强化学习(RL)的多模态大语言模型(MLLM)技术。项目系统梳理了图像理解、图像推理、图像生成等方向的最新★ 104
MM4TSAMM4TSA 是一个专注于多模态时间序列分析(Multi-Modalities for Time Series Analysis)的论文与资源清单项目。它系统整★ 90
Awesome-Mixture-of-Experts这是一个精选的混合专家(MoE)与混合多模态专家(MoME)资源列表,旨在为研究人员和工程师提供系统化的学习与参考入口。项目本身不包含代码实现,而是以目录形式收★ 75
LoFSLoFS 是一个面向本地知识库的桌面级文件管理与信息检索对话应用。它主要解决个人或团队在本地存储大量文件时,缺乏高效管理和智能检索能力的问题。核心能力包括文件管★ 72
PhyXPhyX 是一个专注于物理推理能力评估的开源基准测试项目,旨在回答“你的模型是否具备物理推理的‘智慧’”。它通过设计一系列需要物理常识和因果推断的任务,来测试大★ 55
IISANIISAN 是一个面向推荐系统的多模态基础模型高效适配开源项目。它解决了在推荐场景中直接使用大规模多模态模型(如视觉-语言模型)时计算成本高、适配效率低的问题。★ 54