OmniVinci 是开源模型领域的开源项目,由 NVlabs 开发,2025 年首次发布。
它收录于开源模型分类,该分类目前共有 422 个项目,GitHub 星标数为 682。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。Apache-2.0许可,可免费使用和部署。
它主要面向的使用场景是:多模态内容理解(如视频字幕、音视频摘要)。同类可对比的替代方案包括 ImageBind、AnyMAL、X-LLM。

一个模型同时看懂图像、听懂声音、理解文字,搞定多模态任务。
OmniVinci 是一个全模态大语言模型,旨在联合理解视觉、音频和语言信息。它解决的是传统多模态模型往往只支持文本与图像,而难以同时处理音频、视频等多种模态数据的问题。OmniVinci 的核心能力在于将视觉、音频和语言输入统一到一个模型中,实现跨模态的联合推理与理解。该项目基于 Python 构建,提供了模型架构、训练代码和推理接口,支持研究人员和开发者进行二次开发与实验。目前项目处于早期阶段,GitHub 星标 675,代码库正在快速迭代中。
ImageBind、AnyMAL、X-LLM
OmniVinci 是开源模型领域的开源项目,由 NVlabs 开发,2025 年首次发布。
它收录于开源模型分类,该分类目前共有 422 个项目,GitHub 星标数为 682。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。Apache-2.0许可,可免费使用和部署。
它主要面向的使用场景是:多模态内容理解(如视频字幕、音视频摘要)。同类可对比的替代方案包括 ImageBind、AnyMAL、X-LLM。
上一篇:Awesome-VLA
下一篇:video-SALMONN-2
Machine-Learning
开源
跟着博客笔记,边看边跑机器学习代码
All content related to machine learning from my blog
awesome-claude-fable-5-prompt-va···
开源
一站式掌握 Claude Fable 5 玩法,快速选型不踩坑
Ultimate Claude Fable 5 Guide 2026: Use Cases, Integrations & Benchmarks
Diffusion-Models-Papers-Survey-T···
开源
学视频生成怕绕路?这份资料库帮你理清
Diffusion model papers, survey, and taxonomy
CoreML-Models
开源
下载即用的苹果端 AI 模型库,免去转换烦恼
Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···