SALMONN

让AI听懂声音、看懂画面,多模态对话更自然

SALMONN 是一个先进的多模态大语言模型(LLM)家族,由清华团队开发,旨在让机器能够同时理解和处理语音、音频、音乐、视频等多种模态信息。它解决了传统模型只能处理单一模态(如纯文本或纯图像)的问题,通过统一的架构将音频、视觉和文本信号融合,实现跨模态的理解与推理。其核心能力包括:语音识别与翻译、音频事件检测、音乐理解、视觉问答,以及基于多模态输入的复杂对话生成。SALMONN 支持端到端训练,能够从原始波形中直接提取特征,无需外部语音识别系统,从而在嘈杂环境和多说话人场景下表现更优。该模型在多个公开基准上取得了领先成绩,并提供了不同规模的版本以适应不同算力需求。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1536
维护状态 维护中
是否开源
定价模式 free

项目数据

分类开源模型
开发团队bytedance
所属国家
定价模式free
价格说明开源模型,Apache-2.0 许可证,可免费使用和部署。
访问状态
是否开源
开源协议Apache-2.0
主要语言
技术栈/模型audio,audio-processing,audio-visual-understanding,bytedance,iclr2024,icml-2024,large-language-models,multi-modal,music,research,speech,speech-recognition,tsinghua-university,video,video-understanding
GitHub 星标★ 1536
30天Star增速
HF 下载量
上线时间2023-08-11 00:00:00
最近更新2026-09-21 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:进阶 约 10 分钟 部署方式:模型权重 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 可访问 GitHub 的网络环境(需克隆仓库并切换分支)
  • 已安装 Git 命令行工具
  • Python / CUDA 等运行环境需参照所选分支内的说明(主仓库未给出)
  • 不同分支模型规模不同,算力需求各异

安装与启动步骤

  1. 1克隆主仓库

    将 SALMONN 主仓库克隆到本地。主仓库只是各模型分支的入口,本身不含推理代码。

    git clone https://github.com/bytedance/SALMONN.git
  2. 2进入仓库目录

    切换到克隆下来的 SALMONN 目录,后续所有分支切换操作都在此目录内进行。

    cd SALMONN
  3. 3查看可用分支

    列出远程分支,确认 README 中提到的 salmonn2、ELLSA、videosalmonn、salmonn 等分支名称。

    git branch -a
  4. 4切换到目标分支

    根据不同模型选择分支:SALMONN 2 用 salmonn2,视频版用 videosalmonn,ICLR 2024 版用 salmonn。以 salmonn 分支为例。

    git checkout salmonn
  5. 5阅读分支内说明

    进入分支后查看该分支自己的 README,其中才有对应模型的安装、权重下载与推理命令,主仓库未提供。

    cat README.md

如何确认成功

git branch -a 能列出 salmonn2、ELLSA、videosalmonn、salmonn 等分支,且当前分支内可见 resource 目录与对应 README。

常见问题

Q:主仓库 README 里没有安装和使用步骤怎么办?

A:主仓库只是入口页,安装、权重下载和推理命令都写在各个分支(如 salmonn2、videosalmonn、salmonn)自己的 README 中,需先切换分支再查看。

Q:我应该选哪个分支?

A:按需求选择:想用最新语音模型选 salmonn2,音视频理解选 videosalmonn 或 video-SALMONN-o1,经典 SALMONN(ICLR 2024)选 salmonn 分支。

Q:模型权重在哪里下载?

A:README 节选未给出权重下载地址,请到对应分支的 README 或官网 https://bytedance.github.io/SALMONN 查看。

Q:可以直接在主分支运行推理吗?

A:不可以。主分支仅列出各模型分支链接,推理代码和依赖都在具体分支内,必须切换分支后再按该分支说明操作。

注意事项

  • 主仓库 README 只提供各模型分支链接,不含安装与推理说明,务必先切换到目标分支。
  • 不同分支对应不同论文与版本(ICLR 2024、ICML 2024/2025、ICLR 2026 等),API 与依赖可能互不兼容。
  • 本教程中的命令仅为仓库准备动作,模型运行所需依赖、权重与参数请以分支内 README 为准。
  • 克隆仓库前请确认磁盘空间与网络,模型权重通常体积较大。

核心亮点

  • 统一处理语音、音频、视觉和文本,无需外部ASR,端到端训练
  • 在语音翻译、音频事件检测等任务上刷新多项基准
  • 提供多尺寸模型,兼顾效果与部署灵活性

不足之处

  • 模型参数量较大,推理资源需求高
  • 中文社区资料相对较少,文档/社区待观察

适用场景

  • 智能助手:理解用户语音和视频输入,提供多模态响应
  • 音视频内容分析:自动识别语音、音乐和事件,生成摘要
  • 无障碍辅助:将音频内容转为文字或视觉描述

替代项目

Qwen-Audio、AudioGPT、SpeechGPT

项目介绍

SALMONN 是开源模型领域的开源项目,由 bytedance 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,536)位列前 30%,在开源模型分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,504 增加到 1,536,净增 32。

项目仍在小幅维护中,最近一次代码更新于 2026-09-21。Apache-2.0 许可证,可免费使用和部署。

它主要面向的使用场景是:智能助手:理解用户语音和视频输入,提供多模态响应。同类可对比的替代方案包括 Qwen-Audio、AudioGPT、SpeechGPT。

上一篇:awesome-large-audio-models

下一篇:OralGPT

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10