OmniVinci

一个模型同时看懂图像、听懂声音、理解文字,搞定多模态任务。

OmniVinci 是一个全模态大语言模型,旨在联合理解视觉、音频和语言信息。它解决的是传统多模态模型往往只支持文本与图像,而难以同时处理音频、视频等多种模态数据的问题。OmniVinci 的核心能力在于将视觉、音频和语言输入统一到一个模型中,实现跨模态的联合推理与理解。该项目基于 Python 构建,提供了模型架构、训练代码和推理接口,支持研究人员和开发者进行二次开发与实验。目前项目处于早期阶段,GitHub 星标 675,代码库正在快速迭代中。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 682
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队NVlabs
所属国家
定价模式free
价格说明开源模型,Apache-2.0许可,可免费使用和部署。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型audio-language-model,deep-learning,large-language-models,multimodal-large-language-models,vision-language-model
GitHub 星标★ 682
30天Star增速
HF 下载量
上线时间2025-09-24 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 真正实现视觉、音频、语言三模态联合理解,而非简单拼接
  • 提供完整的训练与推理代码,便于复现和二次开发
  • 基于主流深度学习框架,技术栈清晰,易于扩展

不足之处

  • 项目处于早期阶段,文档和社区支持尚待完善
  • 模型参数量较大,推理资源需求高,部署门槛不低

适用场景

  • 多模态内容理解(如视频字幕、音视频摘要)
  • 智能助手(同时处理语音指令和视觉输入)
  • 跨模态检索与问答(如根据音频和图像回答文本问题)

替代项目

ImageBind、AnyMAL、X-LLM

项目介绍

OmniVinci 是开源模型领域的开源项目,由 NVlabs 开发,2025 年首次发布。

它收录于开源模型分类,该分类目前共有 422 个项目,GitHub 星标数为 682。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。Apache-2.0许可,可免费使用和部署。

它主要面向的使用场景是:多模态内容理解(如视频字幕、音视频摘要)。同类可对比的替代方案包括 ImageBind、AnyMAL、X-LLM。

上一篇:Awesome-VLA

下一篇:video-SALMONN-2

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10