stt-server

WebSocket 实时语音转文字,边说边出字,可换 ASR 后端

stt-server 是一个用 Python 编写的实时语音转文字 WebSocket 服务,目标是把 ASR 能力以流式接口暴露给前端或后端应用。它通过可插拔的 ASR 后端设计,支持接入 Qwen3-ASR、vLLM 等模型服务,避免把识别逻辑与业务代码耦合。核心能力包括:基于能量的 VAD 自动切分语音段,减少无效推理;流式返回部分识别结果,让用户边说边看到文字;内置 Prometheus 指标,方便监控延迟、并发和识别量。项目定位偏基础设施层,适合需要自建实时字幕、语音输入或会议转录能力的团队,用 WebSocket 长连接替代轮询式 HTTP 调用,降低端到端延迟。整体代码量不大,属于早期项目,但方向明确:把 ASR 后端、VAD、流式输出和可观测性打包成一个可直接部署的服务。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 107
维护状态 活跃
是否开源
定价模式 free

项目数据

分类语音识别
开发团队victoryangzhijie
所属国家
官网地址
定价模式free
价格说明开源项目,免费使用
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型ai,asr,qwen,qwen-asr,qwen3,qwen3-asr,real-time,speech-recognition,speech-to-text,streaming,stt,vad,vllm,voice
GitHub 星标★ 107
30天Star增速
HF 下载量
上线时间2026-02-22 00:00:00
最近更新2026-09-14 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

核心亮点

  • ASR 后端可插拔,能接 Qwen3-ASR、vLLM 等,不锁死模型
  • 内置能量 VAD,自动切分语音段,减少无效推理和流量
  • 流式返回 partial 结果,配合 WebSocket 实现低延迟字幕体验

不足之处

  • 项目早期,星标仅 107,生产环境验证和社区案例较少
  • 文档与部署示例可能不完整,接入自定义 ASR 后端需读源码

适用场景

  • 实时字幕:直播、会议、课堂场景下边说话边出文字
  • 语音输入:为聊天、搜索、表单等应用提供流式听写能力
  • 自建 ASR 服务:把 Qwen3-ASR 或 vLLM 封装成统一 WebSocket 接口

替代项目

whisper.cpp、faster-whisper、vosk-api

项目介绍

stt-server 是一个语音识别领域的开源项目,官方简介:Real-time speech-to-text WebSocket server with pluggable ASR backends, energy-based VAD, streaming partial results, and Prometheus observability.。项目使用 Python 开发,在 GitHub 上获得 107 星标。

上一篇:whisrs

下一篇:NeMo-Speech.cpp

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1613 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3713 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11823 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5649 2026-08-13