video-SALMONN-2 是开源模型领域的开源项目,由 bytedance 开发,2025 年首次发布。
它收录于开源模型分类,该分类目前共有 425 个项目,GitHub 星标数为 218。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-21。Apache-2.0 许可证,可免费使用和部署。
它主要面向的使用场景是:视频自动字幕生成与内容描述。同类可对比的替代方案包括 Video-LLaVA、VideoChat、Qwen-VL。

让AI看懂视频也听懂声音,生成精准音视频描述
video-SALMONN-2 是清华大学电子工程系与字节跳动联合开发的新一代音视频大语言模型,旨在解决视频理解中音频与视觉信息融合不足的问题。该模型能够接收视频中的视觉帧和音频轨道,生成高质量的音视频描述(captions),并支持基于视频内容的问答、推理等任务。其核心能力包括:多模态对齐(将音频和视觉特征统一映射到语言空间)、时间感知的序列建模(捕捉视频中事件的时间顺序)、以及细粒度的音视频事件描述(如识别背景音乐、对话、环境音等)。相比前代,SALMONN-2 在长视频理解、跨模态引用和复杂场景推理上有所增强,并提供了公开的模型权重和推理代码。该项目主要面向视频内容理解、自动字幕生成、视频检索等应用场景,适合研究者和开发者进行二次开发。
Video-LLaVA、VideoChat、Qwen-VL
video-SALMONN-2 是开源模型领域的开源项目,由 bytedance 开发,2025 年首次发布。
它收录于开源模型分类,该分类目前共有 425 个项目,GitHub 星标数为 218。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-21。Apache-2.0 许可证,可免费使用和部署。
它主要面向的使用场景是:视频自动字幕生成与内容描述。同类可对比的替代方案包括 Video-LLaVA、VideoChat、Qwen-VL。
上一篇:OmniVinci
下一篇:LLM4Decompile
Machine-Learning
开源
跟着博客笔记,边看边跑机器学习代码
All content related to machine learning from my blog
awesome-claude-fable-5-prompt-va···
开源
一站式掌握 Claude Fable 5 玩法,快速选型不踩坑
Ultimate Claude Fable 5 Guide 2026: Use Cases, Integrations & Benchmarks
CoreML-Models
开源
下载即用的苹果端 AI 模型库,免去转换烦恼
Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···
awesome-ltx2
开源
找齐 LTX-2 模型、工作流和 LoRA,一键上手视频生成。
All available LTX-2 models, encoders, workflows, LoRAs for ComfyUI