Otter

让开源多模态模型听懂指令,看图说话更听话

Otter是一个基于OpenFlamingo的多模态模型,旨在提升视觉-语言任务的指令跟随和上下文学习能力。它针对DeepMind Flamingo的开源版本进行了优化,并在MIMIC-IT数据集上训练,该数据集包含丰富的指令-图像-文本对。Otter的核心能力包括:在给定图像和文本提示时生成相关响应,支持少样本上下文学习,能根据用户指令灵活调整输出风格。它解决了开源多模态模型在指令理解和交互性上的不足,使研究者能基于其进行微调和部署。项目提供模型权重、训练代码和推理示例,降低了多模态AI的入门门槛。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3440
维护状态 低维护
是否开源
定价模式 free

项目数据

分类开源模型
开发团队EvolvingLMMs-Lab
所属国家
定价模式free
价格说明开源模型,MIT许可证,可免费使用和部署。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型artificial-inteligence,chatgpt,deep-learning,embodied-ai,foundation-models,gpt-4,instruction-tuning,large-scale-models,machine-learning,multi-modality,visual-language-learning
GitHub 星标★ 3440
30天Star增速
HF 下载量
上线时间2023-04-01 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:高级 约 30 分钟 部署方式:模型权重 6 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(README 未指定版本,项目语言为 Python)
  • 可访问 HuggingFace 的网络;中国大陆用户可使用 OpenXLab 镜像
  • 足够的磁盘与显存用于存放 7B 级多模态模型权重
  • 能访问 GitHub 仓库 EvolvingLMMs-Lab/Otter 获取代码与文档

安装与启动步骤

  1. 1克隆项目仓库

    从 GitHub 拉取 Otter 源码,README 中说明所有开源代码均已测试且可运行。

    git clone https://github.com/EvolvingLMMs-Lab/Otter.git
  2. 2进入项目目录

    切换到克隆下来的工程目录,后续操作均在此目录下进行。

    cd Otter
  3. 3下载图像模型权重

    README 提供的图像模型 Checkpoint 为 luodian/OTTER-Image-MPT7B,在其 HuggingFace 页面下载权重文件。

  4. 4下载视频模型权重

    如需视频密集描述任务,下载 README 给出的 luodian/OTTER-Video-LLaMA7B-DenseCaption 权重。

  5. 5国内镜像下载

    中国大陆用户可在 OpenXLab 的 YuanhanZhang/OTTER-Image-MPT7B 模型页获取同样的权重。

  6. 6查看 OtterHD 文档

    若使用 OtterHD-8B(基于 Fuyu-8B 微调),阅读仓库 docs/OtterHD.md 了解用法。

如何确认成功

README 未给出明确的启动验证命令,建议按官方文档与推理示例运行,若能正常加载权重并响应图文提问即为成功。

常见问题

Q:README 里没有写安装依赖的命令怎么办?

A:README 节选未提供 pip 安装说明,请直接查看仓库根目录与 docs 目录下的说明文件,或到 GitHub Issues 中询问作者。

Q:国内下载 HuggingFace 权重太慢怎么办?

A:README 专门列出 OpenXLab 镜像,中国大陆用户可改用 openxlab.org.cn 上的 OTTER-Image-MPT7B 与 OTTER-Video-LLaMA7B-DenseCaption 页面下载。

Q:代码质量看起来不够完善,能用吗?

A:README 的 Disclaimer 说明代码可能尚未完全重构打磨,但所有开源代码都经过测试且可运行,作者也欢迎提 issue 和 PR。

Q:有哪些可用的模型权重?

A:README 列出两个:luodian/OTTER-Image-MPT7B(图像)和 luodian/OTTER-Video-LLaMA7B-DenseCaption(视频)。

Q:OtterHD 是什么?

A:2023 年 11 月更新中发布,基于 Fuyu-8B 微调的多模态模型,详情见仓库 docs/OtterHD.md。

注意事项

  • README 节选未包含完整安装步骤与依赖清单,本教程仅覆盖克隆仓库和下载权重等可确认内容。
  • 项目代码可能未完全重构,遇到问题建议到 GitHub 提 issue。
  • 权重文件体积较大,下载前请确认磁盘与显存空间充足。
  • OtterHD 与主模型使用方式不同,需单独阅读其文档。

核心亮点

  • 基于OpenFlamingo,继承了强大的少样本上下文学习能力
  • 在MIMIC-IT指令数据集上训练,指令跟随效果优于原版
  • 提供完整训练和推理代码,便于二次开发

不足之处

  • 模型规模较大,推理资源需求高
  • 文档和社区支持相对薄弱,教程示例有限

适用场景

  • 多模态对话系统开发
  • 图像内容理解与自动标注
  • 少样本视觉问答研究

替代项目

OpenFlamingo、LLaVA、MiniGPT-4

项目介绍

Otter 是开源模型领域的开源项目,由 EvolvingLMMs-Lab 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(3,440)位列前 30%,在开源模型分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,可免费使用和部署。

它主要面向的使用场景是:多模态对话系统开发。同类可对比的替代方案包括 OpenFlamingo、LLaVA、MiniGPT-4。

上一篇:LimiX

下一篇:Emu

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10