
stt-server
WebSocket 实时语音转文字,边说边出字,可换 ASR 后端
stt-server 是一个用 Python 编写的实时语音转文字 WebSocket 服务,目标是把 ASR 能力以流式接口暴露给前端或后端应用。它通过可插拔的 ASR 后端设计,支持接入 Qwen3-ASR、vLLM 等模型服务,避免把识别逻辑与业务代码耦合。核心能力包括:基于能量的 VAD 自动切分语音段,减少无效推理;流式返回部分识别结果,让用户边说边看到文字;内置 Prometheus 指标,方便监控延迟、并发和识别量。项目定位偏基础设施层,适合需要自建实时字幕、语音输入或会议转录能力的团队,用 WebSocket 长连接替代轮询式 HTTP 调用,降低端到端延迟。整体代码量不大,属于早期项目,但方向明确:把 ASR 后端、VAD、流式输出和可观测性打包成一个可直接部署的服务。
项目数据
使用教程
核心亮点
- ASR 后端可插拔,能接 Qwen3-ASR、vLLM 等,不锁死模型
- 内置能量 VAD,自动切分语音段,减少无效推理和流量
- 流式返回 partial 结果,配合 WebSocket 实现低延迟字幕体验
不足之处
- 项目早期,星标仅 107,生产环境验证和社区案例较少
- 文档与部署示例可能不完整,接入自定义 ASR 后端需读源码
适用场景
- 实时字幕:直播、会议、课堂场景下边说话边出文字
- 语音输入:为聊天、搜索、表单等应用提供流式听写能力
- 自建 ASR 服务:把 Qwen3-ASR 或 vLLM 封装成统一 WebSocket 接口
替代项目
whisper.cpp、faster-whisper、vosk-api
项目介绍
上一篇:whisrs
下一篇:NeMo-Speech.cpp
同类项目推荐
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper