mPLUG-2

一个模型搞定图文视频的理解与生成

mPLUG-2 是阿里巴巴达摩院提出的模块化多模态基础模型,发表于 ICML 2023。它旨在统一处理文本、图像和视频三种模态,解决传统多模态模型在跨模态理解和生成任务上能力分散、难以兼顾的问题。核心能力包括:通过模块化设计将模型拆分为共享的视觉/文本编码器和任务特定的解码器,支持跨模态理解(如图文检索、视觉问答)和生成(如图像描述、视频描述)等多样化任务。模型采用两阶段训练策略,先对齐模态再适配任务,在多个公开基准上取得领先效果。其模块化架构允许灵活组合不同模块,便于扩展到新任务和新模态,为多模态大模型的统一设计提供了新思路。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 227
维护状态 低维护
是否开源
定价模式 free

项目数据

分类开源模型
开发团队X-PLUG
所属国家
官网地址
定价模式free
价格说明开源模型,Apache-2.0许可,可免费使用和部署。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型foundation-models,image-retrieval,mllm,mplug,multimodal,multimodal-pretraining,video,video-question-answering,video-retrieval,vqa
GitHub 星标★ 227
30天Star增速
HF 下载量
上线时间2023-05-22 00:00:00
最近更新2026-03-27 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

核心亮点

  • 模块化设计,视觉和文本编码器可复用,扩展新任务成本低
  • 统一支持理解和生成任务,覆盖检索、问答、描述等多种场景
  • 在图像、视频多个基准上达到SOTA,论文发表于ICML 2023

不足之处

  • GitHub星标仅227,社区活跃度低,文档和示例可能不够完善
  • 模型规模较大,推理资源需求高,不适合轻量级部署

适用场景

  • 跨模态检索:用文字搜图片或视频
  • 视觉问答与图像/视频描述生成
  • 多模态对话系统或内容理解平台

替代项目

OFA、Flamingo、BLIP-2

项目介绍

mPLUG-2 是开源模型领域的开源项目,由 X-PLUG 开发,2023 年首次发布。

它收录于开源模型分类,该分类目前共有 422 个项目,GitHub 星标数为 227。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-03-27。Apache-2.0许可,可免费使用和部署。

它主要面向的使用场景是:跨模态检索:用文字搜图片或视频。同类可对比的替代方案包括 OFA、Flamingo、BLIP-2。

上一篇:tapestry

下一篇:time-series-ptms

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1870 2026-08-10