tacotron

用 TensorFlow 复现谷歌 Tacotron,快速实现文本转语音

Tacotron 是一个基于 TensorFlow 的非官方实现,复现了 Google 的 Tacotron 语音合成模型,并提供了预训练模型。该项目旨在将文本转换为自然流畅的语音,解决了从零搭建语音合成系统的门槛问题。核心能力包括:支持英文和中文(通过额外的中文语料训练)、提供完整的训练和合成流程、包含预训练模型可直接使用、支持注意力机制和 Griffin-Lim 声码器。用户可以通过该项目快速体验端到端语音合成,或基于其代码进行二次开发和定制。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2997
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队keithito
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型machine-learning,python,speech-synthesis,tacotron,tensorflow,tts
GitHub 星标★ 2997
30天Star增速
HF 下载量
上线时间2017-07-08 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 4 步

环境要求

  • Python 3
  • TensorFlow 1.3 及以上版本(有 GPU 时建议装 GPU 版以提升性能)
  • pip(用于安装 requirements.txt 依赖)
  • 可访问 GitHub 与 PyPI 的网络环境

安装与启动步骤

  1. 1准备 Python 3

    按 README 要求先在本机装好 Python 3,并确保 pip 可用;后续命令均在项目目录内执行。

  2. 2获取项目代码

    从项目地址克隆仓库到本地,得到一个名为 tacotron 的目录,之后所有命令都在其中运行。

    git clone https://github.com/keithito/tacotron.git
  3. 3安装 TensorFlow

    README 要求安装对应平台的最新版 TensorFlow,有 GPU 建议装 GPU 版;代码兼容 1.3 及以上版本。

    pip install tensorflow
  4. 4安装项目依赖

    进入项目目录后安装 requirements.txt 中列出的依赖,这一步会下载较多 Python 包,需耐心等待。

    cd tacotron
    pip install -r requirements.txt

如何确认成功

README 节选未提供启动或合成命令;确认 pip install -r requirements.txt 执行无报错、TensorFlow 能正常导入,即表示环境准备完成。

常见问题

Q:TensorFlow 版本有什么要求?

A:README 说明支持 TensorFlow 1.3 及更高版本,并建议安装对应平台的最新版;若有 GPU 环境,装 GPU 版可获得更好性能。

Q:训练多久语音才听得懂?

A:README 提到用 LJ Speech 数据集训练约 20K 步后语音开始变得可辨识,其示例模型共训练了 441K 步。

Q:项目支持中文吗?

A:Tacotron 本体是英文实现,中文需要额外语料训练;README 节选只给出英文数据集(LJ Speech、Nancy Corpus)的示例。

Q:有没有已经训练好的模型?

A:项目简介说明提供预训练模型,可直接使用;README 节选未给出具体下载命令,需到仓库中查看相关说明。

注意事项

  • README 的 Quick Start 只覆盖依赖安装,未包含训练或合成命令,实际使用前请再阅读仓库中其他文档。
  • README 提到有第三方 fork 加入了 Tacotron 2 的 location-sensitive attention 与 stop token,可显著减少所需训练数据。
  • 示例音频使用 LJ Speech 数据集(441K 步)和 Nancy Corpus(140K 步)训练,可用于判断预期效果。

核心亮点

  • 提供预训练模型,下载即可直接合成语音,无需从头训练
  • 代码结构清晰,训练和合成流程完整,易于上手
  • 支持英文和中文,灵活性较高

不足之处

  • 非官方实现,模型细节可能与原版有差异
  • 依赖旧版 TensorFlow,环境配置可能较麻烦
  • 文档/社区待观察

适用场景

  • 快速搭建文本转语音原型
  • 学习端到端语音合成技术
  • 基于预训练模型进行定制化语音生成

替代项目

Tacotron2、FastSpeech、ESPnet

项目介绍

tacotron 是音频音乐领域的开源项目,由 keithito 开发,2017 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,997)位列前 30%,在音频音乐分类的 738 个项目里位列前 8%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:快速搭建文本转语音原型。同类可对比的替代方案包括 Tacotron2、FastSpeech、ESPnet。

上一篇:vae_tacotron2

下一篇:pitchtron

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09