WhisperLiveKit

本地实时语音转文字,兼容 OpenAI/Deepgram API,秒级部署

WhisperLiveKit 是一个实时、本地的语音转文字工具包,基于 OpenAI Whisper 模型,提供流式语音识别(ASR)、说话人分离(speaker diarization)、翻译以及兼容 OpenAI 和 Deepgram 的 API 接口。它解决了传统云语音服务延迟高、隐私风险大、成本高的问题,让开发者能在本地或自有服务器上搭建低延迟的实时转录服务。核心能力包括:流式音频处理,支持麦克风或音频流输入;说话人识别,区分不同发言者;多语言翻译,将转录结果实时翻译成其他语言;提供 REST 和 WebSocket API,方便集成到现有应用中。项目采用 Python 和 PyTorch 构建,依赖 FastAPI 提供高性能服务,适合需要实时字幕、会议记录、语音助手等场景。其设计强调模块化和易用性,开发者可以快速部署并定制自己的语音处理管道。

开源 free 语音识别
GitHub 星标 ★ 10611
维护状态 活跃
是否开源
定价模式 free

项目数据

分类语音识别
开发团队QuentinFuxa
所属国家
官网地址
定价模式free
价格说明开源项目,免费使用,定价信息待确认
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型automatic-speech-recognition,fastapi,python,pytorch,real-time,speaker-diarization,speech-recognition,speech-to-text,streaming,translation,websocket,whisper
GitHub 星标★ 10611
30天Star增速
HF 下载量
上线时间2024-12-19 00:00:00
最近更新2026-08-16 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-17
浏览次数0

核心亮点

  • 流式 ASR 延迟低,支持实时字幕和交互
  • 内置说话人分离,区分发言者提升会议记录效率
  • 兼容 OpenAI 和 Deepgram API,迁移成本低

不足之处

  • 对硬件资源要求较高,需 GPU 才能流畅运行大模型
  • 文档/社区待观察

适用场景

  • 实时会议字幕与记录
  • 语音助手和交互式应用
  • 本地化语音转写服务(如医疗、法律等敏感领域)

替代项目

whisper.cpp、faster-whisper、Vosk

项目介绍

WhisperLiveKit 是一个语音识别领域的开源项目,官方简介:Real-time, local speech-to-text with streaming ASR, speaker diarization, translation, and OpenAI/Deepgram-compatible APIs.。项目使用 Python 开发,在 GitHub 上获得 10611 星标。

上一篇:whisper-diarization

下一篇:没有了!

同类项目推荐

espnet 开源

语音识别、合成、翻译一把抓,一个工具箱全搞定

End-to-End Speech Processing Toolkit

★ 9924 2026-08-09
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3529 2026-08-10
speaches 开源

一键部署,即刻拥有 OpenAI 兼容的语音转文字服务

★ 3593 2026-08-10
cheetah 开源

在设备上实时把语音转文字,离线低延迟还保护隐私

On-device streaming speech-to-text engine powered by deep learning

★ 670 2026-08-10