multimodal-deep-learning

本站收录 15 个带「multimodal-deep-learning」标签的 AI 开源项目

FinRobotFinRobot 是一个开源的金融 AI 智能体平台,基于大语言模型构建,旨在为金融应用提供一站式解决方案。它解决了金融领域数据复杂、分析门槛高、决策效率低等问★ 8,109Time-LLMTime-LLM 是一个面向时间序列预测的开源模型,其核心思路是“重编程”大型语言模型(LLM),将时间序列数据转化为文本原型,从而利用 LLM 强大的模式识别★ 2,701Awesome-Text-to-ImageAwesome-Text-to-Image 是一个聚焦文本到图像生成/合成领域的精选资源列表,旨在系统梳理该方向的研究进展、关键技术和开源工具。它解决了研究人员★ 2,447BitNetBitNet 是微软论文《BitNet: Scaling 1-bit Transformers for Large Language Models》的 PyTo★ 1,946CVPR2024-Papers-with-Code-Demo这是一个CVPR 2024论文与代码的精选合集,旨在解决计算机视觉领域研究者难以快速获取最新成果和复现资源的问题。项目系统性地整理了CVPR 2024上发表的论★ 1,411awesome-multimodal-in-medical-imaging这是一个关于医学影像中多模态学习应用资源的精选列表,收录了论文、数据集、代码和工具,覆盖多模态融合、跨模态生成、医学视觉语言模型等方向。它解决了医学影像领域多模★ 982blended-latent-diffusionBlended Latent Diffusion 是 SIGGRAPH 2023 论文的官方实现,用于文本驱动的图像局部编辑。它解决的是传统扩散模型在编辑图像时★ 631MMMUMMMU 是一个大规模多学科多模态理解与推理基准测试集,旨在评估和推动 AI 模型在专家级通用人工智能(AGI)方向上的能力。它包含来自艺术、工程、科学等六大领★ 597VQASynthVQASynth 是一个面向多模态数据集构建的开源工具,核心目标是把普通图像或视频转化为带有空间推理能力的视觉问答(VQA)训练数据。它通过场景重建与空间关系抽★ 591OmniShowOmniShow 是字节跳动推出的统一视频生成模型,专注于人-物交互(HOI)视频生成,论文发表于 ICML 2026。它基于扩散模型(DiT/MMDiT)架构★ 475DOFADOFA 是一个受神经可塑性启发的多模态地球观测基础模型,旨在解决遥感领域不同模态(如光学、雷达、高光谱等)数据分布差异大、难以统一建模的问题。它通过动态融合和★ 214IDvs.MoRecIDvs.MoRec 是一个面向多模态推荐系统的端到端训练框架,由快手主导开源。它针对当前推荐系统中广泛使用的 ID 序列建模与新兴的多模态内容(如文本、图像、★ 169LLM-PuzzleTestLLM-PuzzleTest 是一个专注于多模态谜题推理的开源项目,主要发布用于评估和提升大语言模型(LLM)在多模态谜题场景下推理能力的数据集和模型。该项目针★ 119VisualWebBenchVisualWebBench 是一个针对多模态大语言模型(MLLMs)在网页理解与定位(Grounding)任务上的评估框架,源自同名论文。它解决的核心问题是:★ 68SpatialEvalSpatialEval 是一个用于评估多模态大语言模型(MLLMs)和纯语言模型(LLMs)空间推理能力的基准测试工具,相关论文发表于 NeurIPS 2024★ 61