mllm

本站收录 37 个带「mllm」标签的 AI 开源项目

unilmUniLM是微软开源的大规模自监督预训练模型系列,旨在统一处理自然语言理解与生成任务。它基于Transformer架构,通过掩码语言建模、序列到序列建模等预训练★ 22,226Agent-SAgent-S 是一个开源的智能体框架,目标是让 AI 像人类一样操作计算机。它通过 Agent-Computer Interface(ACI)把屏幕截图、鼠标★ 12,420Awesome-LLM-ReasoningAwesome-LLM-Reasoning 是一个精心整理的资源列表,聚焦于大语言模型(LLM)的推理能力,覆盖从经典的 Chain-of-Thought(Co★ 3,690EagleEagle 是一个前沿的视觉-语言模型(VLM)项目,强调以数据为中心的策略来提升模型性能。它解决了当前多模态模型在数据利用效率和训练效果上的瓶颈,通过精心设计★ 3,641NExT-GPTNExT-GPT是新加坡国立大学团队在ICML 2024发表的任意模态大语言模型,支持文本、图像、音频和视频的任意输入与输出组合。它采用LLM作为核心大脑,通过★ 3,636InternLM-XComposerInternLM-XComposer 是上海人工智能实验室推出的多模态大模型系统,最新版本 2.5-OmniLive 专注于长时流式视频与音频的实时交互。它解决★ 2,928cambrianCambrian-1 是一个以视觉为中心设计的开源多模态大语言模型(MLLM)家族。它解决的是当前多模态模型在视觉感知能力上受限的问题,强调通过视觉中心的设计来★ 2,011awesome-yolo-object-detectionawesome-yolo-object-detection 是一个精选 YOLO 目标检测系列开源项目和数据集的资源合集。它系统整理了 YOLO 从 v1 到 ★ 1,794Sa2VASa2VA 是一个面向图像与视频分割任务的统一视觉语言模型代码库,由 Pixel-LLM 团队维护。它解决了传统分割模型难以理解自然语言指令并完成复杂时空分割的★ 1,682awesome-vlm-architectures这是一个精心整理的视觉语言模型(VLM/MLLM)架构目录,收录了155+个相关模型,涵盖论文、架构图、训练配方、数据集以及发布时间线。项目以可视化的方式呈现多★ 1,324NEONEO 是一个从第一性原理出发构建的原生视觉-语言模型系列,旨在解决当前多模态模型依赖外部视觉编码器、架构复杂且训练不透明的问题。项目强调端到端的原生多模态理解★ 896JarvisArtJarvisArt 是一个基于大语言模型的智能照片修图代理,旨在解放人类艺术创造力。它通过理解用户的自然语言指令,自动完成从图像分析、风格迁移到细节调整等一系列★ 8724KAgent4KAgent 是一个基于智能体(Agent)的任意图像 4K 超分辨率开源项目,发表于 NeurIPS 2025。它解决传统超分模型对输入图像类型敏感、难以处★ 831WoodpeckerWoodpecker 是一个针对多模态大语言模型(MLLM)的幻觉纠正工具。它通过训练一个轻量级的纠正器,在模型生成文本后,利用视觉知识库和交叉验证机制,自动检★ 650GromaGroma 是一个基于多模态大语言模型(MLLM)的视觉定位模型,核心创新在于“局部视觉标记化”(Localized Visual Tokenization)。★ 586Awesome-LLMs-meet-Multimodal-Generation这是一个精选论文列表,聚焦于基于大语言模型(LLM)的多模态生成领域,涵盖图像、视频、3D和音频四大模态。项目系统梳理了LLM与多模态生成结合的前沿研究,包括多★ 552CraneCrane 是一个基于纯 Rust 构建的 LLM、VLM、VLA、TTS、OCR 推理引擎,底层依赖 Candle 框架。它的目标是成为 llama.cpp ★ 485LLMGALLMGA是一个基于多模态大语言模型的图像生成助手,源自ECCV 2024 Oral论文。它旨在解决用户难以精确控制图像生成和编辑的问题,通过将大语言模型的推理★ 395Awesome_Multimodel_LLMAwesome_Multimodel_LLM 是一个精选资源列表,专注于多模态大语言模型(MLLM)领域。它系统整理了相关数据集、微调技术、上下文学习、视觉推理★ 379mega-data-factorymega-data-factory 是一个面向大规模基础模型训练的多模态数据流水线框架,专注于解决数据质量与数据规模之间的平衡问题。它提供了一套从数据采集、清洗★ 379EVEEVE是北京智源人工智能研究院(BAAI)推出的免编码器视觉语言模型系列。传统视觉语言模型通常依赖预训练的视觉编码器(如ViT)来提取图像特征,而EVE直接以像★ 376LLM2JevLLM2Jev 是一个把本地大语言模型(含多模态模型)改造成 Jev 风格结构化决策模型的开发框架。传统 LLM 生成结果需要逐 token 解码,速度慢且输出★ 367Awesome-LVLM-Hallucination这是一个持续更新的精选列表,汇总了大型视觉语言模型(LVLM)幻觉研究的最新论文、资源和相关工作。它旨在解决LVLM在生成文本时可能产生与图像内容不符的幻觉信息★ 332ArtifactsBenchmarkArtifactsBenchmark 是一个用于评估和比较 AI 生成工件(如代码、文档、设计稿等)质量的基准测试框架。它解决了当前 AI 模型在生成复杂、多步★ 279LLaVA-MoDLLaVA-MoD 是一个面向多模态大语言模型的高效压缩方案,通过结合混合专家(MoE)与知识蒸馏技术,将原本庞大的 LLaVA 模型压缩为轻量级版本,同时保持★ 227mPLUG-2mPLUG-2 是阿里巴巴达摩院提出的模块化多模态基础模型,发表于 ICML 2023。它旨在统一处理文本、图像和视频三种模态,解决传统多模态模型在跨模态理解和★ 227DecoDeco 是一个针对多模态大语言模型(MLLM)的幻觉缓解工具,核心方法为动态校正解码(Dynamic Correction Decoding)。它解决了 ML★ 147DimpleDimple 是首个离散扩散多模态大语言模型(Discrete Diffusion MLLM),把文本生成从传统的自回归逐词预测改为离散扩散式的并行去噪生成。它★ 117Awesome-Multimodal-Reasoning这是一个精选多模态推理与生成前沿资源的列表,聚焦于基于强化学习(RL)的多模态大语言模型(MLLM)技术。项目系统梳理了图像理解、图像推理、图像生成等方向的最新★ 104SEEChatSEEChat 是一个多模态对话助手,集成了计算机视觉能力,属于第一代大型多模态模型(LMM)。它基于 Python 构建,结合了聊天机器人和 GPT-4 等先★ 102AwesomeMultiModel这是一个AIGC实战入门笔记项目,旨在帮助开发者系统学习和上手各类AIGC技术。项目内容覆盖大语言模型(LLMs)、高效微调(SFT)、检索增强生成(RAG)、★ 79Awesome-Video-MLLMsAwesome-Video-MLLMs 是一个专注于视频多模态大模型(MLLMs)及其基准测试的资源汇总项目,覆盖短视频、长视频和流式视频理解三大场景。它系统整★ 74VideoLucyVideoLucy 是一个面向长视频理解的开源项目,发表于 NeurIPS 2025,核心创新在于“深度记忆回溯”(Deep Memory Backtracki★ 69VisualWebBenchVisualWebBench 是一个针对多模态大语言模型(MLLMs)在网页理解与定位(Grounding)任务上的评估框架,源自同名论文。它解决的核心问题是:★ 68Awesome-MLLM-Uncertainty这是一个精选多模态大语言模型(MLLM)不确定性研究论文的列表项目,旨在系统梳理该领域的最新进展。它解决的是MLLM在推理过程中缺乏可靠置信度、容易产生幻觉或错★ 59VisionFoundryVisionFoundry 是一个专注于提升视觉语言模型(VLM)视觉感知能力的开源训练框架。它通过合成图像数据来训练模型,解决真实图像数据稀缺、标注成本高的问★ 57Re-AlignRe-Align 是一个针对视觉语言模型(VLM)幻觉问题的对齐框架,发表于 EMNLP 2025。它通过引入图像检索机制,在模型生成文本时检索相关图像作为额外★ 52