RealtimeSTT

一句话唤醒,边说边出字,实时语音转写零门槛。

RealtimeSTT 是一个基于 Python 的实时语音转文字库,专注于低延迟和高效能。它解决了语音交互场景中常见的痛点:传统 STT 需要手动控制录音起止,而 RealtimeSTT 通过内置的先进语音活动检测(VAD)自动识别说话开始和结束,并支持唤醒词激活,实现免提式语音输入。其核心能力包括即时转录(边说边出字)、流式处理、以及针对不同硬件(CPU/GPU)的优化。项目设计为即插即用,提供简洁的 API,开发者可以快速集成到自己的应用中,无需深入了解底层音频处理和语音识别细节。它适用于需要实时反馈的交互场景,如语音助手、会议记录、实时字幕等。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 10069
维护状态 活跃
是否开源
定价模式 free

项目数据

分类语音识别
开发团队KoljaB
所属国家
官网地址
定价模式free
价格说明开源免费
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型python,realtime,speech-to-text
GitHub 星标★ 10069
30天Star增速
HF 下载量
上线时间2023-08-29 00:00:00
最近更新2026-08-21 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-22
浏览次数0

核心亮点

  • 内置 VAD 和唤醒词,自动检测语音起止,无需手动按键,交互更自然。
  • 流式转录延迟低,实测在 CPU 上也能实现边说边出字,体验流畅。
  • API 设计简洁,几行代码即可集成,支持自定义模型和参数,灵活度高。

不足之处

  • 文档和示例相对较少,高级配置(如自定义唤醒词)需要阅读源码。
  • 对多说话人区分(diarization)支持有限,会议等多人场景效果待提升。

适用场景

  • 智能语音助手(如家庭中控、车载语音)
  • 实时字幕生成(直播、视频会议)
  • 语音控制应用(游戏、无障碍工具)

替代项目

faster-whisper、Vosk、SpeechRecognition

项目介绍

RealtimeSTT 是一个语音识别领域的开源项目,官方简介:A robust, efficient, low-latency speech-to-text library with advanced voice activity detection, wake word activation and instant transcription.。项目使用 Python 开发,在 GitHub 上获得 10069 星标。

上一篇:whisper-timestamped

下一篇:没有了!

同类项目推荐

LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3556 2026-08-10
espnet 开源

语音识别、合成、翻译一把抓,一个工具箱全搞定

End-to-End Speech Processing Toolkit

★ 9928 2026-08-09
speaches 开源

一键部署,即刻拥有 OpenAI 兼容的语音转文字服务

★ 3606 2026-08-10
cheetah 开源

在设备上实时把语音转文字,离线低延迟还保护隐私

On-device streaming speech-to-text engine powered by deep learning

★ 670 2026-08-10