SenseVoice

一个模型搞定多语言识别、情感和事件检测,开箱即用

SenseVoice 是阿里开源的语音基础模型,主打多语言语音识别(ASR),支持中文、粤语、英文、日语和韩语。它不仅能转写文字,还集成了语种识别、情感识别和音频事件检测(如音乐、掌声等)能力,一个模型搞定多项语音理解任务。项目基于 FunASR 框架,提供 SenseVoiceSmall 轻量模型,推理速度快,适合实时或近实时场景。核心解决传统语音识别系统在多语言、情感和事件分析上需要多个模型串联、部署复杂、延迟高的问题。其技术栈包含 Llama 相关组件,模型在多种公开和内部数据上训练,在中文和粤语上表现尤其突出。项目代码和模型权重开源,支持直接推理和微调,方便开发者集成到语音助手、客服质检、内容审核等应用中。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 9349
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类语音识别
开发团队QwenAudio
所属国家
官网地址
定价模式free
价格说明开源模型,提供在线Demo,完全免费使用。
访问状态
是否开源是
开源协议MIT
主要语言C
技术栈/模型asr,audio-analysis,audio-event-detection,cantonese,cross-lingual,emotion-detection,funasr,language-identification,llama-cpp,multilingual,multilingual-asr,pytorch,sensevoice,speech-emotion-recognition,speech-recognition,speech-to-text,speech-understanding,transcription,voice-ai,whisper-alternative
GitHub 星标★ 9349
30天Star增速
HF 下载量
上线时间2024-07-03 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:Docker 7 步

环境要求

  • Python 环境与 pip(用于安装 funasr / funasr-onnx)
  • Docker(用于构建和运行 SenseVoice 容器镜像)
  • GPU 运行需 NVIDIA 驱动并支持 docker run --gpus all;纯 CPU 也可运行
  • 如需无 Python 环境运行,需使用 llama.cpp/GGUF 版 SenseVoice 预编译二进制

安装与启动步骤

  1. 1安装 Python 依赖

    用 pip 安装 FunASR 与 funasr-onnx,供 Python 侧调用 SenseVoiceSmall 模型推理。

    pip3 install -U funasr funasr-onnx
  2. 2构建 Docker 镜像

    在项目根目录执行构建,生成名为 sensevoice 的本地镜像;官方 ghcr 镜像当前为私有,需本地构建。

    docker build -t sensevoice .
  3. 3GPU 方式启动容器

    默认 GPU 模式启动,映射 50000 端口并挂载模型缓存卷,模型文件会保存在 sensevoice-models 卷中。

    docker run --rm --gpus all -p 50000:50000 -v sensevoice-models:/models sensevoice
  4. 4CPU 方式启动容器

    无 GPU 时通过环境变量切换到 CPU 推理,其余端口与模型卷参数与 GPU 模式一致。

    docker run --rm -e SENSEVOICE_DEVICE=cpu -p 50000:50000 -v sensevoice-models:/models sensevoice
  5. 5使用 Docker Compose

    compose 会构建同样的镜像并复用模型缓存卷;默认不请求 GPU,因此直接在 CPU 主机上启动。

    docker compose up --build
  6. 6FastAPI 方式部署

    非容器方式启动 FastAPI 服务,先用环境变量指定推理设备(如 cuda:0),再以 50000 端口运行。

    export SENSEVOICE_DEVICE=cuda:0
    fastapi run --port 50000
  7. 7llama.cpp 无依赖运行

    无需 GPU 和 Python:先下载 GGUF 模型与内置 FSMN-VAD,再用单文件二进制对音频文件做识别。

    bash runtime/llama.cpp/download-funasr-model.sh sensevoice ./gguf
    llama-funasr-sensevoice -m ./gguf/sensevoice-small-f16.gguf --vad ./gguf/fsmn-vad.gguf -a audio.wav

关键配置

配置项必填说明示例
SENSEVOICE_DEVICE否指定推理设备,不设置时容器默认使用 CPUcuda:0
--port否FastAPI 与容器对外提供服务的端口50000
model_dir否Python 调用时加载的模型仓库名(ModelScope)iic/SenseVoiceSmall
batch_size否funasr-onnx 推理时的批处理大小10
quantize否funasr-onnx 是否启用量化推理True

如何确认成功

容器或服务启动后访问 http://127.0.0.1:50000/docs,能看到 FastAPI 接口文档页面即部署成功。

常见问题

Q:拉取 ghcr.io/qwenaudio/sensevoice 失败报 401?

A:该容器包目前是私有的,匿名拉取会返回 HTTP 401,请改用 README 中的 docker build -t sensevoice . 本地构建镜像。

Q:没有 GPU 可以运行吗?

A:可以。容器方式加 -e SENSEVOICE_DEVICE=cpu 即可;Docker Compose 默认也是 CPU;此外还可用 llama.cpp/GGUF 二进制在 CPU 或边缘设备上运行。

Q:SenseVoiceSmall 能直接做说话人分离吗?

A:不能。说话人分离是 FunASR 的组合流程,需要额外的 FSMN-VAD 和 CAM++ 模型,并非 SenseVoiceSmall 检查点本身的输出。

Q:支持哪些语言和任务?

A:SenseVoiceSmall 支持中文、粤语、英文、日语、韩语的语音识别与语种识别,并附带情感与音频事件标签输出。

注意事项

  • README 说明 ghcr 上的镜像包当前为私有,匿名拉取会 401,构建与运行请使用本地构建的镜像。
  • Docker Compose 的默认配置不请求 GPU,GPU 场景请使用 docker run --gpus all 的命令。
  • 容器监听端口为 50000,模型缓存在 sensevoice-models 卷中,删除卷会重新下载模型。
  • llama.cpp 版为单文件二进制、内置 FSMN-VAD、运行时不依赖 Python,需从 Releases 获取预编译版本。

核心亮点

  • 多语言支持广,中英日韩粤语一次识别,省去多模型切换
  • 推理速度快,SenseVoiceSmall 轻量设计,适合实时场景
  • 集成情感识别和音频事件检测,功能全面,减少系统复杂度

不足之处

  • 模型对非主流方言和口音鲁棒性待验证
  • 文档和社区生态相比成熟ASR项目(如Whisper)仍待完善

适用场景

  • 实时语音转写与字幕生成,覆盖多语言会议和直播
  • 客服中心通话质检,自动识别情绪和关键事件
  • 智能语音助手,同时理解语种、情感和背景音

替代项目

Whisper、FunASR、Kaldi

项目介绍

SenseVoice 是语音识别领域的开源项目,由 QwenAudio 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(9,349)位列前 6%,在语音识别分类的 212 个项目里位列前 8%。

近 41 天,它的 GitHub 星标从 9,061 增加到 9,349,净增 288。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。提供在线Demo,完全免费使用。从国内网络环境看,可用性暂无实测数据。

它主要面向的使用场景是:实时语音转写与字幕生成,覆盖多语言会议和直播。同类可对比的替代方案包括 Whisper、FunASR、Kaldi。

上一篇:vosk-api

下一篇:speech_recognition

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13