TransformerTTS

用 Transformer 并行合成语音,告别逐字慢速生成

TransformerTTS 是一个基于非自回归 Transformer 架构的文本转语音(TTS)开源实现,由 Axel Springer AI 团队开发。它解决了传统自回归 TTS 模型(如 Tacotron)推理速度慢、难以并行生成的问题。核心能力包括:使用 Transformer 的注意力机制直接并行生成梅尔频谱,显著提升合成速度;支持多说话人训练;提供完整的训练和推理流程。项目基于 TensorFlow 实现,代码结构清晰,适合研究非自回归 TTS 的入门参考。尽管项目已停止维护,但其提出的非自回归思路对后续 TTS 模型(如 FastSpeech)有启发意义。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1161
维护状态 低维护
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队spring-media
所属国家
定价模式free
价格说明开源项目,完全免费,需自行部署使用。
访问状态
是否开源
开源协议NOASSERTION
主要语言Python
技术栈/模型axelspringerai,deep-learning,python,tensorflow,text-to-speech,tts
GitHub 星标★ 1161
30天Star增速
HF 下载量
上线时间2020-03-26 00:00:00
最近更新2026-09-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

难度:进阶 约 10 分钟 部署方式:本地安装 6 步

环境要求

  • Python >= 3.6
  • Linux 环境(espeak 用 apt-get 安装;macOS 用 brew)
  • TensorFlow 2(项目为 TF2 实现)
  • 可用的 TTS 训练数据集(如 LJSpeech)
  • pip 及 requirements.txt 中依赖

安装与启动步骤

  1. 1获取项目代码

    从 GitHub 克隆仓库并进入项目目录,后续命令都在该目录下执行。

    git clone https://github.com/spring-media/TransformerTTS.git
    cd TransformerTTS
  2. 2安装 espeak

    作为 phonemizer 的后端,Linux 用 apt-get 安装;macOS 请改用 brew 安装。

    sudo apt-get install espeak
  3. 3安装 Python 依赖

    在项目根目录执行,按 requirements.txt 安装全部 Python 依赖,耗时取决于网络。

    pip install -r requirements.txt
  4. 4编辑配置路径

    在 config/training_config.yaml 中把数据集和日志文件夹路径改成自己的实际路径,必改。

  5. 5选择配置模板

    默认配置生成 MelGAN/HiFiGAN 兼容模型;若需 WaveRNN 兼容,把 data_config_wavernn.yaml 内容替换进 training_config.yaml。

  6. 6查看脚本参数

    README 未列出训练/推理命令,需自行阅读各脚本源码获取命令行参数。

关键配置

配置项必填说明示例
training_config.yaml → 数据集路径指向你的训练数据集目录,README 要求必须编辑(具体键名见文件)/your/path/to/LJSpeech-1.1
training_config.yaml → 日志文件夹路径指向日志/模型输出目录,README 要求必须编辑(具体键名见文件)/your/path/to/logs

如何确认成功

README 未给出启动命令;依赖安装无报错,且配置好路径后脚本能正常读取数据。

常见问题

Q:macOS 上怎么装 espeak?

A:README 提示 macOS 使用 brew 安装 espeak,命令为 brew install espeak,而不是 apt-get。

Q:生成的模型能配哪些声码器?

A:预训练 LJSpeech 模型兼容 MelGAN 和 HiFiGAN;旧版本也支持 WaveRNN,需生成对应配置的模型。

Q:想快速用声码器推理怎么做?

A:README 指出可切换到 vocoding 分支(Vocoding branch)进行快速推理。

Q:训练和推理的命令在哪看?

A:README 未给具体命令,提示阅读各个脚本获取更多命令行参数,训练与模型设置写在 training_config.yaml。

注意事项

  • 项目已停止维护,仅适合作为非自回归 TTS 的研究参考。
  • README 未给出具体 YAML 键名,请在 config/training_config.yaml 中查找路径相关项。
  • 默认配置适配 MelGAN/HiFiGAN;要用 WaveRNN 需替换 data_config_wavernn.yaml 的内容。
  • README 未提供明确的启动/验证命令,需自行阅读脚本源码。

核心亮点

  • 非自回归架构,生成速度比自回归模型快数倍
  • 代码结构清晰,基于 TensorFlow,易于复现实验
  • 支持多说话人训练,提供预训练模型和采样音频

不足之处

  • 项目已停止维护,依赖旧版 TensorFlow 1.x,环境配置困难
  • 语音自然度不如自回归模型,存在发音错误
  • 文档和社区支持有限

适用场景

  • 学术研究:探索非自回归 TTS 架构
  • 快速原型验证:需要快速生成语音的场景
  • 教育学习:理解 Transformer 在 TTS 中的应用

替代项目

FastSpeech、Tacotron 2、ESPnet-TTS

项目介绍

TransformerTTS 是音频音乐领域的开源项目,由 spring-media 开发,2020 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,161)位列前 30%,在音频音乐分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。完全免费,需自行部署使用。

它主要面向的使用场景是:学术研究:探索非自回归TTS架构。同类可对比的替代方案包括 FastSpeech、Tacotron 2、ESPnet-TTS。

上一篇:dia2

下一篇:Irodori-TTS

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09