Ovis

让视觉与语言无缝对齐,构建更强多模态大模型。

Ovis是一个多模态大语言模型(MLLM)架构,旨在从结构上对齐视觉和文本嵌入。它解决了传统多模态模型在融合视觉与语言信息时存在的语义鸿沟问题,通过创新的嵌入对齐机制,让模型能更精准地理解图像与文本的关联。核心能力包括:支持基于Llama3和Qwen等主流语言模型构建多模态版本,提供灵活的视觉编码器集成,以及针对视觉-语言任务优化的训练流程。项目代码以Python为主,适合研究者和开发者用于图像问答、视觉推理等场景,当前处于成长阶段,社区活跃度中等。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1522
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队ATH-MaaS
所属国家
官网地址
定价模式free
价格说明开源模型,Apache-2.0许可,可免费本地部署使用,无在线服务。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型chatbot,llama3,multimodal,multimodal-large-language-models,multimodality,qwen,vision-language-learning,vision-language-model
GitHub 星标★ 1522
30天Star增速
HF 下载量
上线时间2024-06-13 00:00:00
最近更新2026-09-17 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 5 步

环境要求

  • Python 3.10(README 明确测试版本)
  • conda 环境管理工具
  • Torch 2.4.0
  • Transformers 4.51.3
  • DeepSpeed 0.15.4

安装与启动步骤

  1. 1克隆代码仓库

    用 SSH 方式克隆 Ovis 仓库到本地,需提前配置 GitHub SSH Key,否则可改用 HTTPS 地址。

    git clone git@github.com:AIDC-AI/Ovis.git
  2. 2创建conda环境

    创建名为 ovis 的 Python 3.10 环境并激活,README 声明项目在 Python 3.10 下测试。

    conda create -n ovis python=3.10 -y
    conda activate ovis
  3. 3安装项目依赖

    进入 Ovis 目录,按 requirements.txt 安装全部依赖,再以可编辑模式安装项目本身。

    cd Ovis
    pip install -r requirements.txt
    pip install -e .
  4. 4安装vLLM(可选)

    README 单独列出 vLLM 安装方式,如需 vLLM 推理加速再执行,非必须步骤。

    pip install vllm==0.10.2 --extra-index-url https://wheels.vllm.ai/0.10.2/
  5. 5获取模型权重

    README 未给出下载命令,权重发布在 Hugging Face 的 AIDC-AI/Ovis2.5 集合,需自行前往下载 2B/9B 版本。

如何确认成功

README 未提供验证方式,确认 conda 环境已激活、pip install 全程无报错即视为环境就绪。

常见问题

Q:没有安装 conda 怎么办?

A:README 未说明,需自行安装 Miniconda 或 Anaconda 后,再执行创建 ovis 环境的命令。

Q:vLLM 必须安装吗?

A:不必须。README 将 vLLM 单独列出,只在需要该推理后端时执行对应 pip 命令。

Q:依赖版本可以直接用新版吗?

A:README 声明在 Python 3.10、Torch 2.4.0、Transformers 4.51.3、DeepSpeed 0.15.4 下测试,建议保持一致。

Q:模型权重从哪里获取?

A:托管在 Hugging Face,见 AIDC-AI/Ovis2.5 集合,包含 Ovis2.5-2B 与 9B 等版本。

注意事项

  • SSH 克隆需已配置 GitHub SSH Key,否则改用 HTTPS 克隆地址。
  • 完整依赖清单以仓库内 requirements.txt 为准。
  • README 未给出推理示例命令,安装完成后需自行参考模型页面使用。

核心亮点

  • 创新架构:从结构层面对齐视觉和文本嵌入,优于简单的拼接或投影方法
  • 兼容主流模型:支持Llama3和Qwen,方便复用现有生态
  • 代码清晰:Python实现,模块化设计,便于二次开发

不足之处

  • 文档/社区待观察
  • 项目尚在成长,示例和教程可能不够丰富

适用场景

  • 学术研究:探索多模态嵌入对齐的新方法
  • 视觉问答:构建能理解图像并回答问题的助手
  • 多模态内容理解:如社交媒体图像与文本联合分析

替代项目

LLaVA、Qwen-VL、InternVL

项目介绍

Ovis 是开源模型领域的开源项目,由 ATH-MaaS 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,522)位列前 30%,在开源模型分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,501 增加到 1,522,净增 21。

项目仍在小幅维护中,最近一次代码更新于 2026-09-17。Apache-2.0许可,可免费本地部署使用,无在线服务。

它主要面向的使用场景是:学术研究:探索多模态嵌入对齐的新方法。同类可对比的替代方案包括 LLaVA、Qwen-VL、InternVL。

上一篇:nlp_xiaojiang

下一篇:z80ai

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10