RealtimeTTS

实时把文字变语音,低延迟流式输出,轻松集成各种 TTS 引擎。

RealtimeTTS 是一个专注于实时文本转语音(TTS)的 Python 库,旨在解决传统 TTS 引擎延迟高、难以集成到实时应用中的问题。它提供了统一的 API 接口,支持多种主流 TTS 引擎(如 Coqui TTS、Azure TTS、ElevenLabs 等),并具备流式输出、低延迟、多语言支持等核心能力。通过简单的调用,开发者可以轻松实现将文本实时转换为自然流畅的语音,适用于语音助手、实时字幕、游戏配音、无障碍辅助等场景。该库设计轻量,易于扩展,并提供了丰富的示例和文档,帮助开发者快速上手。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4033
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队KoljaB
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型python,realtime,speech-synthesis,text-to-speech
GitHub 星标★ 4033
30天Star增速
HF 下载量
上线时间2023-08-26 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 环境(Windows 预编译 PyAudio 轮子覆盖 Python 3.10–3.13)
  • Linux 需先安装 python3-dev 与 portaudio19-dev
  • macOS 需先安装 portaudio
  • QwenEngine 需 x86-64 的 Windows 或 Linux 系统并配备 NVIDIA GPU(macOS 及其他平台非支持发布目标)

安装与启动步骤

  1. 1安装系统引擎

    最快本地体验方式,安装 realtimetts 的 system 额外组件;该额外组件依赖 PyAudio,需先装好系统音频库。

    pip install "realtimetts[system]"
  2. 2安装Linux音频依赖

    Linux 上使用 system 等传统引擎前,先安装 PortAudio 头文件与 python3-dev,否则 PyAudio 会编译失败。

    sudo apt-get update
    sudo apt-get install python3-dev portaudio19-dev
  3. 3安装macOS音频依赖

    macOS 上通过 Homebrew 安装 portaudio,为 PyAudio 提供底层音频支持。

    brew install portaudio
  4. 4安装Qwen服务组件

    可选,安装后可将原生 Qwen 引擎以 OpenAI 兼容 HTTP API 暴露;该服务为无头模式,不安装 PyAudio。

    pip install "realtimetts[qwen-server]"
  5. 5安装Stanza分句支持

    可选,默认安装不含 Stanza 与 PyTorch;仅在需要 Stanza 分句时才额外安装。

    pip install "realtimetts[stanza]"

关键配置

配置项必填说明示例
默认绑定地址否qwen-server 默认仅监听回环地址,需显式改绑才能被局域网访问127.0.0.1
--allow-lan否需暴露到局域网时使用,并配合内置 API Key 或可信反向代理做认证--allow-lan

如何确认成功

README 未提供启动验证命令;可用 pip show realtimetts 查看已安装版本,确认安装成功。

常见问题

Q:macOS 能用 Qwen 原生引擎吗?

A:不能。RealtimeTTS 0.7.4 只为 x86-64 的 Windows 和 Linux 声明了已验证的原生 Qwen 轮子,macOS 等平台不是支持的发布目标。

Q:安装 Qwen 原生轮子需要本地 CUDA Toolkit 吗?

A:不需要。README 明确说明 Qwen 原生轮子本身不要求本地安装 CUDA Toolkit,但需要受支持的 Windows/Linux 系统与 NVIDIA GPU。

Q:装 system 等额外组件时报 PyAudio 相关错误怎么办?

A:先安装 PortAudio:Linux 执行 apt-get install python3-dev portaudio19-dev,macOS 执行 brew install portaudio,再重新安装额外组件。

Q:qwen-server 会直接暴露到公网吗?

A:默认不会,它只绑定回环地址 127.0.0.1;局域网暴露需显式 --allow-lan 并配合内置 API Key,或用终止 TLS 的可信反向代理认证。

注意事项

  • CORS 默认仅允许明确的 localhost 来源并拒绝通配符 *,但 CORS 不是访问控制边界,不能当作安全防护手段。
  • qwen-server 为无头服务,不安装 PyAudio/PortAudio,适合部署在服务器端。
  • Qwen 引擎在受支持的 Windows/Linux + NVIDIA GPU 环境下被推荐用于高质量低延迟对话语音,README 示例基于调优后的 RTX 4090。
  • 如需了解 Qwen 部署、协议、许可与资产边界,README 指向 docs/engines/qwen.md 的 HTTP 服务器章节。

核心亮点

  • 统一 API 封装多种 TTS 引擎,切换成本低
  • 流式输出,首包延迟低,适合实时交互
  • 支持多语言,满足全球化应用需求

不足之处

  • 依赖外部 TTS 服务,部分引擎需付费或网络
  • 文档/社区待观察

适用场景

  • 语音助手实时对话
  • 直播/游戏实时语音播报
  • 无障碍阅读辅助工具

替代项目

Coqui TTS、pyttsx3、gTTS

项目介绍

RealtimeTTS 是音频音乐领域的开源项目,由 KoljaB 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(4,033)位列前 30%,在音频音乐分类的 738 个项目里位列前 7%。

近 42 天,它的 GitHub 星标从 4,010 增加到 4,033,净增 23。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:语音助手实时对话。同类可对比的替代方案包括 Coqui TTS、pyttsx3、gTTS。

上一篇:DiffSinger

下一篇:MOSS-TTS

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09