RealtimeSTT

一句话唤醒,边说边出字,实时语音转写零门槛。

RealtimeSTT 是一个基于 Python 的实时语音转文字库,专注于低延迟和高效能。它解决了语音交互场景中常见的痛点:传统 STT 需要手动控制录音起止,而 RealtimeSTT 通过内置的先进语音活动检测(VAD)自动识别说话开始和结束,并支持唤醒词激活,实现免提式语音输入。其核心能力包括即时转录(边说边出字)、流式处理、以及针对不同硬件(CPU/GPU)的优化。项目设计为即插即用,提供简洁的 API,开发者可以快速集成到自己的应用中,无需深入了解底层音频处理和语音识别细节。它适用于需要实时反馈的交互场景,如语音助手、会议记录、实时字幕等。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 10159
维护状态 较活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类语音识别
开发团队KoljaB
所属国家
官网地址
定价模式free
价格说明开源免费
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型python,realtime,speech-to-text
GitHub 星标★ 10159
30天Star增速
HF 下载量
上线时间2023-08-29 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-22
浏览次数10

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:入门 约 10 分钟 部署方式:库/依赖 6 步

环境要求

  • Python 3.11 或 3.12(README 说明 3.13 及以上暂不是发布目标)
  • Linux 需先安装 python3-dev 与 portaudio19-dev
  • macOS 需先安装 PortAudio(brew install portaudio)
  • 可联网下载 pip 包与模型文件

安装与启动步骤

  1. 1确认 Python 版本

    README 的 CI 仅覆盖 Python 3.11 与 3.12,3.13 及更新版本暂不支持,请先切到受支持的版本。

  2. 2安装系统音频依赖

    在 Linux 上必须先装 PortAudio 头文件,否则后续安装 RealtimeSTT 会失败。

    sudo apt-get update
    sudo apt-get install python3-dev portaudio19-dev
  3. 3安装 macOS 依赖

    macOS 用户改用 Homebrew 安装 PortAudio,再执行下一步的 pip 安装。

    brew install portaudio
  4. 4安装 RealtimeSTT

    按 README 推荐的通用默认路径安装 faster-whisper 附加依赖,这是默认引擎。

    pip install "RealtimeSTT[faster-whisper]"
  5. 5安装CPU流式栈

    Linux x86-64 生产流式可选:装 server 与 sherpa-onnx 附加依赖并下载两个模型包。

    python -m pip install "RealtimeSTT[server,sherpa-onnx]"
    stt-install-sherpa-models --root ./models/sherpa-onnx --model all
  6. 6查阅配置文档

    引擎选择、实时转录、VAD 时序、唤醒词、回调等构造参数都在 docs/configuration.md。

如何确认成功

安装完成后在 Python 中导入 RealtimeSTT 不报错,即为安装成功;README 未提供运行示例。

常见问题

Q:支持 Python 3.13 吗?

A:不支持。当前 CI 矩阵只覆盖 Python 3.11 和 3.12,3.13 及更新版本要等依赖与 CI 条件就绪后才会纳入。

Q:Linux 安装时报找不到 portaudio 怎么办?

A:先运行 sudo apt-get update,再安装 python3-dev 和 portaudio19-dev,然后重新执行 pip 安装命令。

Q:默认使用哪个识别引擎?

A:通用默认路径使用 faster_whisper。其他引擎需通过安装 extras,并自行准备对应的可选依赖与模型后才能使用。

Q:CPU 上如何获得更好的流式识别效果?

A:Linux x86-64 生产流式推荐 sherpa-onnx:nemotron 流式模型只处理新增音频帧做实时文本,parakeet 在收尾时生成最终转写。

注意事项

  • README 只给出安装与配置入口,没有完整运行示例代码,建议先阅读 docs/installation.md 与 docs/configuration.md。
  • 命令中的 ./models/sherpa-onnx 是 README 给出的示例路径,可替换为你自己的存放目录。
  • 两个 sherpa-onnx 模型包需联网下载,请预留磁盘空间并保证网络稳定。

核心亮点

  • 内置 VAD 和唤醒词,自动检测语音起止,无需手动按键,交互更自然。
  • 流式转录延迟低,实测在 CPU 上也能实现边说边出字,体验流畅。
  • API 设计简洁,几行代码即可集成,支持自定义模型和参数,灵活度高。

不足之处

  • 文档和示例相对较少,高级配置(如自定义唤醒词)需要阅读源码。
  • 对多说话人区分(diarization)支持有限,会议等多人场景效果待提升。

适用场景

  • 智能语音助手(如家庭中控、车载语音)
  • 实时字幕生成(直播、视频会议)
  • 语音控制应用(游戏、无障碍工具)

替代项目

faster-whisper、Vosk、SpeechRecognition

项目介绍

RealtimeSTT 是语音识别领域的开源项目,由 KoljaB 开发,2023 年首次发布。

在全站 13,752 个收录项目中,它的 GitHub 星标数(10,159)位列前 5%,在语音识别分类的 257 个项目里位列前 6%。

近 45 天,它的 GitHub 星标从 10,069 增加到 10,159,净增 90。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-17。开源免费。

它主要面向的使用场景是:智能语音助手(如家庭中控、车载语音)。同类可对比的替代方案包括 faster-whisper、Vosk、SpeechRecognition。

上一篇:whisper-timestamped

下一篇:speechbrain

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1623 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3812 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11852 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5662 2026-08-13