
RealtimeSTT
一句话唤醒,边说边出字,实时语音转写零门槛。
RealtimeSTT 是一个基于 Python 的实时语音转文字库,专注于低延迟和高效能。它解决了语音交互场景中常见的痛点:传统 STT 需要手动控制录音起止,而 RealtimeSTT 通过内置的先进语音活动检测(VAD)自动识别说话开始和结束,并支持唤醒词激活,实现免提式语音输入。其核心能力包括即时转录(边说边出字)、流式处理、以及针对不同硬件(CPU/GPU)的优化。项目设计为即插即用,提供简洁的 API,开发者可以快速集成到自己的应用中,无需深入了解底层音频处理和语音识别细节。它适用于需要实时反馈的交互场景,如语音助手、会议记录、实时字幕等。
开源
free
语音识别
GitHub 星标
★ 10069
维护状态
活跃
是否开源
是
定价模式
free
项目数据
分类语音识别
开发团队KoljaB
所属国家
定价模式free
价格说明开源免费
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型python,realtime,speech-to-text
GitHub 星标★ 10069
30天Star增速
HF 下载量
上线时间2023-08-29 00:00:00
最近更新2026-08-21 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-22
浏览次数0
核心亮点
- 内置 VAD 和唤醒词,自动检测语音起止,无需手动按键,交互更自然。
- 流式转录延迟低,实测在 CPU 上也能实现边说边出字,体验流畅。
- API 设计简洁,几行代码即可集成,支持自定义模型和参数,灵活度高。
不足之处
- 文档和示例相对较少,高级配置(如自定义唤醒词)需要阅读源码。
- 对多说话人区分(diarization)支持有限,会议等多人场景效果待提升。
适用场景
- 智能语音助手(如家庭中控、车载语音)
- 实时字幕生成(直播、视频会议)
- 语音控制应用(游戏、无障碍工具)
替代项目
faster-whisper、Vosk、SpeechRecognition
项目介绍
下一篇:没有了!
同类项目推荐
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
espnet
开源
语音识别、合成、翻译一把抓,一个工具箱全搞定
End-to-End Speech Processing Toolkit
speaches
开源
一键部署,即刻拥有 OpenAI 兼容的语音转文字服务
cheetah
开源
在设备上实时把语音转文字,离线低延迟还保护隐私
On-device streaming speech-to-text engine powered by deep learning