
WhisperLiveKit
本地实时语音转文字,兼容 OpenAI/Deepgram API,秒级部署
WhisperLiveKit 是一个实时、本地的语音转文字工具包,基于 OpenAI Whisper 模型,提供流式语音识别(ASR)、说话人分离(speaker diarization)、翻译以及兼容 OpenAI 和 Deepgram 的 API 接口。它解决了传统云语音服务延迟高、隐私风险大、成本高的问题,让开发者能在本地或自有服务器上搭建低延迟的实时转录服务。核心能力包括:流式音频处理,支持麦克风或音频流输入;说话人识别,区分不同发言者;多语言翻译,将转录结果实时翻译成其他语言;提供 REST 和 WebSocket API,方便集成到现有应用中。项目采用 Python 和 PyTorch 构建,依赖 FastAPI 提供高性能服务,适合需要实时字幕、会议记录、语音助手等场景。其设计强调模块化和易用性,开发者可以快速部署并定制自己的语音处理管道。
开源
free
语音识别
GitHub 星标
★ 10611
维护状态
活跃
是否开源
是
定价模式
free
项目数据
分类语音识别
开发团队QuentinFuxa
所属国家
定价模式free
价格说明开源项目,免费使用,定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型automatic-speech-recognition,fastapi,python,pytorch,real-time,speaker-diarization,speech-recognition,speech-to-text,streaming,translation,websocket,whisper
GitHub 星标★ 10611
30天Star增速
HF 下载量
上线时间2024-12-19 00:00:00
最近更新2026-08-16 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-17
浏览次数0
核心亮点
- 流式 ASR 延迟低,支持实时字幕和交互
- 内置说话人分离,区分发言者提升会议记录效率
- 兼容 OpenAI 和 Deepgram API,迁移成本低
不足之处
- 对硬件资源要求较高,需 GPU 才能流畅运行大模型
- 文档/社区待观察
适用场景
- 实时会议字幕与记录
- 语音助手和交互式应用
- 本地化语音转写服务(如医疗、法律等敏感领域)
替代项目
whisper.cpp、faster-whisper、Vosk
项目介绍
下一篇:没有了!
同类项目推荐
espnet
开源
语音识别、合成、翻译一把抓,一个工具箱全搞定
End-to-End Speech Processing Toolkit
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speaches
开源
一键部署,即刻拥有 OpenAI 兼容的语音转文字服务
cheetah
开源
在设备上实时把语音转文字,离线低延迟还保护隐私
On-device streaming speech-to-text engine powered by deep learning