WhisperLive

让 Whisper 实时转写,直播字幕、会议记录秒出

WhisperLive 是一个基于 OpenAI Whisper 的近乎实时语音转写工具,旨在解决传统 Whisper 离线处理延迟高、无法用于直播或对话场景的问题。它通过流式音频处理、分块转录和智能静音检测,实现低至数百毫秒的延迟转写,支持多语言识别和翻译。核心能力包括:实时麦克风输入转写、音频文件流式处理、WebSocket 服务端部署,以及可选的说话人分离(需额外配置)。项目基于 Python,兼容多种推理后端(如 TensorRT、OpenVINO、ROCm),并支持 GPU 加速,适合用于字幕生成、会议记录、语音助手等场景。其设计强调模块化和易扩展,开发者可轻松集成到现有工作流中。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4292
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队collabora
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型dictation,obs,openai,openvino,openvino-intel,rocm,tensorrt,tensorrt-llm,text-to-speech,translation,voice-recognition,whisper,whisper-tensorrt
GitHub 星标★ 4292
30天Star增速
HF 下载量
上线时间2023-05-04 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 6 步

环境要求

  • Python 3.12(Fedora 可用 sudo dnf install -y python3.12 python3.12-pip 安装)
  • PortAudio 系统依赖(麦克风输入经 PyAudio 需要,脚本自动装 portaudio19-dev / portaudio-devel / brew
  • 能执行 bash 脚本的类 Unix 环境(Debian/Ubuntu、Fedora、macOS)
  • Docker 方案需支持 --gpus all 的 NVIDIA 容器运行时(可选)

安装与启动步骤

  1. 1安装系统依赖

    运行仓库自带脚本安装 PortAudio,供麦克风输入使用。Debian/Ubuntu 装 portaudio19-dev,Fedora 装 portaudio-devel,macOS 用 Homebrew。

    bash scripts/setup.sh
  2. 2创建虚拟环境

    用 Python 3.12 建 venv 并激活,后续依赖都装在该环境里。需在项目目录下执行。

    python3.12 -m venv whisper_env
    source whisper_env/bin/activate
  3. 3安装 whisper-live

    从 PyPI 安装 whisper-live 包,包含服务端与客户端脚本。保持虚拟环境处于激活状态。

    pip install whisper-live
  4. 4启动转写服务端

    默认用 faster_whisper 后端,监听 9090,最多 4 个客户端、单连接最长 600 秒。也可加 -fw 指定自定义模型、-c 指定缓存目录。

    python3 run_server.py --port 9090 --backend faster_whisper --max_clients 4 --max_connection_time 600
  5. 5转写音频文件

    另开终端运行客户端,默认连接 localhost:9090,用 --files 指定要转写的音频。可用 --server、--port 改连接地址。

    python3 run_client.py --files tests/jfk.wav
  6. 6Docker 方式启动

    GPU 版 faster-whisper 镜像一条命令即可,端口映射 9090,需宿主机有 NVIDIA GPU 运行时。

    docker run -it --gpus all -p 9090:9090 ghcr.io/collabora/whisperlive-gpu:latest

关键配置

配置项必填说明示例
--port是服务端监听端口,客户端默认连 90909090
--backend是推理后端,可选 faster_whisper、tensorrt、openvinofaster_whisper
--max_clients否限制同时连接的客户端数量,默认 44
--max_connection_time否单个客户端最长连接时间(秒),默认 600600
lang否输入音频语言,仅多语言模型适用en
model否Whisper 模型大小,也支持 hf_model 写法small

如何确认成功

服务端在 9090 端口正常监听,客户端连接后控制台持续输出转写文本(如 tests/jfk.wav 的识别结果)即为成功。

常见问题

Q:麦克风输入报 PortAudio 相关错误怎么办?

A:PortAudio 是 PyAudio 的系统依赖,需先执行 bash scripts/setup.sh 安装(Ubuntu 装 portaudio19-dev,Fedora 装 portaudio-devel,macOS 走 Homebrew)。

Q:TensorRT 后端出现 CrossAttentionMask 警告或崩溃?

A:TensorRT 后端默认使用 C++ session,可加 --trt_py_session 参数改用 Python session;官方建议 TensorRT 只在 Docker 环境使用。

Q:怎么限制服务器被同时连接的数量和时长?

A:启动时用 --max_clients 控制最大客户端数(默认 4),用 --max_connection_time 控制单客户端连接秒数(默认 600)。

Q:在 Intel CPU/iGPU/dGPU 上怎么跑?

A:可用 OpenVINO 后端:python3 run_server.py -p 9090 -b openvino。推荐在 Docker 中运行以自动启用 GPU,非 Docker 需自行装好 Intel 驱动与 OpenVINO 运行时。

注意事项

  • TensorRT 后端需要先构建好 TensorRT 引擎,官方推荐只使用 Docker 方案,详见 TensorRT_whisper readme。
  • enable_translation、target_language、save_output_recording 等为客户端 Python API 参数,run_client.py 命令行方式需以脚本实际支持的参数为准。
  • Docker 命令依赖宿主机 NVIDIA 容器运行时,无 GPU 时 --gpus all 会失败。

核心亮点

  • 延迟低至数百毫秒,真正接近实时转写
  • 支持多种推理后端(TensorRT/OpenVINO/ROCm),适配不同硬件
  • 提供 WebSocket 接口,便于集成到其他应用

不足之处

  • 依赖外部 VAD 模型,静音检测可能误判
  • 文档/社区待观察

适用场景

  • 直播实时字幕生成
  • 会议/讲座即时记录与翻译
  • 语音助手或交互式对话系统

替代项目

faster-whisper、whisper.cpp、Vosk

项目介绍

WhisperLive 是语音识别领域的开源项目,由 collabora 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(4,292)位列前 10%,在语音识别分类的 212 个项目里位列前 15%。

近 42 天,它的 GitHub 星标从 4,226 增加到 4,292,净增 66。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:直播实时字幕生成。同类可对比的替代方案包括 faster-whisper、whisper.cpp、Vosk。

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13