mPLUG-Owl

看图说话+指令对话,让AI同时读懂文字和图像

mPLUG-Owl是阿里巴巴达摩院开发的多模态大语言模型家族,旨在让AI同时理解文本和图像,并基于指令进行对话。它解决了传统语言模型只能处理文本、无法理解视觉信息的问题,核心能力包括视觉-语言对齐、指令微调和多轮对话。模型通过两阶段训练(先对齐视觉与语言,再微调指令)实现图文联合理解,支持图像描述、视觉问答、图文推理等任务。基于HuggingFace生态,提供预训练权重和推理代码,便于研究者使用。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2539
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队X-PLUG
所属国家
定价模式free
价格说明开源模型,提供在线Demo体验,完全免费。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型alpaca,chatbot,chatgpt,damo,dialogue,gpt,gpt4,gpt4-api,huggingface,instruction-tuning,large-language-models,llama,mplug,mplug-owl,multimodal,pretraining,pytorch,transformer,video,visual-recognition
GitHub 星标★ 2539
30天Star增速
HF 下载量
上线时间2023-04-25 00:00:00
最近更新2026-09-18 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 20 分钟 部署方式:模型权重 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(项目开发语言为 Python)
  • Git,用于克隆 GitHub 仓库
  • 可访问 HuggingFace 的网络环境(权重托管在 HuggingFace)
  • 能访问 ModelScope 在线体验页(可选)

安装与启动步骤

  1. 1克隆项目仓库

    从 GitHub 拉取 mPLUG-Owl 主仓库,仓库内含 Owl、Owl2、Owl3 三个版本的独立子目录。

    git clone https://github.com/X-PLUG/mPLUG-Owl.git
  2. 2进入主目录

    进入克隆下来的项目根目录,根目录下按版本分开放置代码与文档。

    cd mPLUG-Owl
  3. 3选择版本子目录

    README 列出 mPLUG-Owl、mPLUG-Owl2、mPLUG-Owl3 三个目录,按需求进入其一,最新为 Owl3。

    cd mPLUG-Owl3
  4. 4阅读子目录文档

    节选的 README 未给出安装与运行命令,需进入对应版本目录查看其 README 与代码获取真实用法。

  5. 5下载模型权重

    访问 README 给出的 HuggingFace 权重页面获取权重;Owl3 权重页面为 mPLUG/mPLUG-Owl3-7B-240728。

关键配置

配置项必填说明示例
模型权重仓库是README 给出的 Owl3 权重下载地址https://huggingface.co/mPLUG/mPLUG-Owl3-7B-240728
中文增强版权重仓库否mPLUG-Owl2.1 中文增强版权重地址https://huggingface.co/Mizukiluke/mplug_owl_2_1

如何确认成功

README 节选未提供启动命令与端口,无法据此验证;请以对应版本子目录内的文档说明为准。

常见问题

Q:应该选 Owl、Owl2 还是 Owl3?

A:三个版本分别放在同名子目录中。Owl3 于 2024.08.12 发布,是最新版本;Owl2 被 CVPR 2024 接收为 Highlight,可按需求选择。

Q:模型权重在哪里下载?

A:权重托管在 HuggingFace:Owl3 见 mPLUG/mPLUG-Owl3-7B-240728,中文增强版 Owl2.1 见 Mizukiluke/mplug_owl_2_1。

Q:有在线试用的地方吗?

A:有。README 给出 ModelScope 体验页 https://www.modelscope.cn/studios/damo/mPLUG-Owl,可直接在线试用。

Q:为什么教程里没有安装命令?

A:本次 README 节选只有更新日志、许可和版本链接,没有安装说明,因此只能给出克隆仓库、进入版本目录等通用准备动作。

注意事项

  • 本次 README 节选缺少依赖、显存、端口等安装信息,实际部署请查阅各版本子目录内的说明文档。
  • 项目内容许可方式见仓库根目录 LICENSE 文件。
  • 三个版本代码相互独立,不要混用不同版本的代码与权重。

核心亮点

  • 视觉-语言联合理解,支持图像输入和文本对话
  • 两阶段训练策略,有效对齐视觉与语言特征
  • 基于HuggingFace,开箱即用,支持自定义微调

不足之处

  • 文档/社区待观察
  • 模型规模较大,推理资源需求高

适用场景

  • 图像问答与描述
  • 多模态对话系统
  • 视觉推理与教育辅助

替代项目

LLaVA、MiniGPT-4、OpenFlamingo

项目介绍

mPLUG-Owl 是开源模型领域的开源项目,由 X-PLUG 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,539)位列前 30%,在开源模型分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-18。提供在线Demo体验,完全免费。从国内网络环境看,可直接访问。

它主要面向的使用场景是:图像问答与描述。同类可对比的替代方案包括 LLaVA、MiniGPT-4、OpenFlamingo。

上一篇:Linly

下一篇:cambrian

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10