WhisperLiveKit

本地实时语音转文字,兼容 OpenAI/Deepgram API,秒级部署

WhisperLiveKit 是一个实时、本地的语音转文字工具包,基于 OpenAI Whisper 模型,提供流式语音识别(ASR)、说话人分离(speaker diarization)、翻译以及兼容 OpenAI 和 Deepgram 的 API 接口。它解决了传统云语音服务延迟高、隐私风险大、成本高的问题,让开发者能在本地或自有服务器上搭建低延迟的实时转录服务。核心能力包括:流式音频处理,支持麦克风或音频流输入;说话人识别,区分不同发言者;多语言翻译,将转录结果实时翻译成其他语言;提供 REST 和 WebSocket API,方便集成到现有应用中。项目采用 Python 和 PyTorch 构建,依赖 FastAPI 提供高性能服务,适合需要实时字幕、会议记录、语音助手等场景。其设计强调模块化和易用性,开发者可以快速部署并定制自己的语音处理管道。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 11103
维护状态 较活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类语音识别
开发团队QuentinFuxa
所属国家
官网地址
定价模式free
价格说明开源项目,免费使用,定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型automatic-speech-recognition,fastapi,python,pytorch,real-time,speaker-diarization,speech-recognition,speech-to-text,streaming,translation,websocket,whisper
GitHub 星标★ 11103
30天Star增速
HF 下载量
上线时间2024-12-19 00:00:00
最近更新2026-09-29 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-17
浏览次数9

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 5 步

环境要求

  • Python 3.11 ~ 3.13
  • 已安装 pip(用于安装 whisperlivekit 包)
  • 默认音频处理依赖 FFmpeg(使用 --pcm-input 可绕过)
  • 可选 GPU:支持 CUDA / Apple Silicon(MLX、MPS);纯 CPU 也可运行

安装与启动步骤

  1. 1安装 whisperlivekit

    README 提供的唯一安装方式,用 pip 从 PyPI 安装。建议在虚拟环境中执行,避免污染系统环境。

    pip install whisperlivekit
  2. 2启动转录服务

    启动本地服务,默认模型 small、监听 localhost:8000。模型首次运行会自动下载,需保证网络可用。

    whisperlivekit-server --model small --host localhost --port 8000
  3. 3开启说话人分离

    加上 --diarization 可区分不同发言者,默认使用 sortformer 后端。需要额外模型权重,首次加载较慢。

    whisperlivekit-server --model small --diarization
  4. 4开启实时翻译

    用 --target-language 指定目标语言,默认走 NLLB 在进程内翻译,CPU 友好;语言列表见 docs/supported_languages.md。

    whisperlivekit-server --model small --target-language zh
  5. 5切换 ASR 后端

    --backend 可选 mlx-whisper、faster-whisper、whisper、openai-api、funasr、qwen3-streaming、canary 等,auto 会按平台自动选择。

    whisperlivekit-server --backend faster-whisper --model small

关键配置

配置项必填说明示例
--model否Whisper 模型规格,越大越准但越慢small
--host否服务监听地址,默认 localhostlocalhost
--port否服务监听端口,默认 80008000
--language否识别语言,auto 表示自动检测但偏向英语auto
--target-language否设置后启用 NLLB 实时翻译到目标语言zh
--backend否ASR 后端选择,auto 按平台自动挑auto

如何确认成功

服务启动后监听 http://localhost:8000,浏览器打开该地址即可看到前端界面,对着麦克风说话能看到实时转写文字。

常见问题

Q:端口 8000 被占用怎么办?

A:启动时加 --port 指定其他端口,例如 --port 8080,然后访问 http://localhost:8080 即可。

Q:想用 HTTPS 访问怎么办?

A:使用 --ssl-certfile 和 --ssl-keyfile 分别指定证书与私钥文件路径,服务即以 HTTPS 方式提供。

Q:前端要用别的域名访问,CORS 报错?

A:用 --cors-origins 传入逗号分隔的允许来源列表,或用 * 允许全部来源,留空则关闭 CORS。

Q:模型下载很慢或想用本地模型?

A:可用 --model-path 指定本地 .pt 文件/目录或 Hugging Face 仓库 ID,它会覆盖 --model 设置。

Q:识别延迟高怎么调?

A:可尝试 --asr-coalesce-min-s 增大累积音频以减少编码次数,或 --backend-policy localagreement 换策略。

注意事项

  • README 未给出前端页面地址的完整示例,仅从 --port 默认 8000 推断访问入口,请以实际启动日志为准。
  • --no-vac / --no-vad 会关闭语音活动检测,README 明确标注 NOT ADVISED,不建议关闭。
  • --warmup-file 默认使用 jfk.wav 做模型预热,若该文件不存在可能影响首次启动体验。
  • --pcm-input 模式下输入需为 raw PCM (s16le) 且会绕过 FFmpeg,前端改用 AudioWorklet。

核心亮点

  • 流式 ASR 延迟低,支持实时字幕和交互
  • 内置说话人分离,区分发言者提升会议记录效率
  • 兼容 OpenAI 和 Deepgram API,迁移成本低

不足之处

  • 对硬件资源要求较高,需 GPU 才能流畅运行大模型
  • 文档/社区待观察

适用场景

  • 实时会议字幕与记录
  • 语音助手和交互式应用
  • 本地化语音转写服务(如医疗、法律等敏感领域)

替代项目

whisper.cpp、faster-whisper、Vosk

项目介绍

WhisperLiveKit 是语音识别领域的开源项目,由 QuentinFuxa 开发,2024 年首次发布。

在全站 13,366 个收录项目中,它的 GitHub 星标数(11,103)位列前 5%,在语音识别分类的 217 个项目里位列前 6%。

近 44 天,它的 GitHub 星标从 10,611 增加到 11,103,净增 492。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-29。免费使用。

它主要面向的使用场景是:实时会议字幕与记录。同类可对比的替代方案包括 whisper.cpp、faster-whisper、Vosk。

上一篇:whisper-diarization

下一篇:whisper-timestamped

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1619 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3786 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11848 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5659 2026-08-13