dc_tts

用 TensorFlow 快速训练轻量级语音合成模型,适合研究入门

dc_tts 是一个基于 TensorFlow 实现的端到端文本转语音(TTS)模型,源自论文“Efficiently Trainable Text-to-Speech System Based on Deep Convolutional Networks with Guided Attention”。它解决传统 TTS 系统训练复杂、依赖大量人工特征工程的问题,通过深度卷积网络和引导注意力机制,直接从文本和语音频谱中学习映射关系。核心能力包括:支持多说话人训练、提供预训练模型、支持在线合成演示,并具备波形生成功能。项目代码结构清晰,适合研究者快速上手复现实验,也为开发者提供了轻量级的 TTS 集成参考。虽然项目停止维护,但其简洁的设计和较少的依赖使其仍可作为学习端到端 TTS 原理的入门示例。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1159
维护状态 低维护
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队Kyubyong
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0 许可证,可自由使用,无付费版本。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型speech,speech-to-text,tts
GitHub 星标★ 1159
30天Star增速
HF 下载量
上线时间2017-11-23 00:00:00
最近更新2026-09-05 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(项目为 Python 语言实现)
  • NumPy >= 1.11.1
  • TensorFlow >= 1.3(注意 tf.contrib.layers.layer_norm 的 API 自 1.3 起有变化)
  • librosa、tqdm、matplotlib、scipy
  • 用于训练的语音数据集(如 LJ Speech Dataset,需自行下载)

安装与启动步骤

  1. 1克隆代码仓库

    从 GitHub 拉取 dc_tts 项目源码到本地,后续所有操作都在该目录中进行。

    git clone https://github.com/Kyubyong/dc_tts.git
    cd dc_tts
  2. 2安装依赖库

    README 的 Requirements 中列出全部依赖,使用 pip 一次性安装;TensorFlow 需选 1.3 及以上版本。

    pip install numpy tensorflow librosa tqdm matplotlib scipy
  3. 3下载语音数据集

    README 使用 LJ Speech、Nick Offerman 有声书、Kate Winslet 有声书以及 KSS 韩语数据集,需按 README 中给出的链接自行下载并解压到本地。

  4. 4检查运行环境

    依次导入 README 要求的库,确认全部安装成功且版本可用;出现 ImportError 说明依赖未装好。

    python -c "import numpy, tensorflow, librosa, tqdm, matplotlib, scipy; print('ok')"

如何确认成功

执行 python -c "import numpy, tensorflow, librosa, tqdm, matplotlib, scipy" 无报错,且语音数据集已下载解压完成,即表示环境准备就绪。

常见问题

Q:TensorFlow 版本有要求吗?

A:README 要求 TensorFlow >= 1.3,并特别提示自 1.3 起 tf.contrib.layers.layer_norm 的 API 发生了变化,版本过低会导致代码不兼容。

Q:需要哪些 Python 依赖?

A:NumPy >= 1.11.1、TensorFlow >= 1.3、librosa、tqdm、matplotlib、scipy,共六项,均写在 README 的 Requirements 中。

Q:必须用哪个数据集?

A:README 在四个数据集上训练了英文和韩文模型:LJ Speech(约 24 小时,最常用的基准集)、Nick Offerman 与 Kate Winslet 有声书(18 小时与 5 小时)、以及韩语 KSS 数据集。

Q:README 里为什么没有训练和合成命令?

A:当前 README 节选只包含 Requirements 与 Data 两部分,未给出训练、合成的具体命令,需自行查看仓库其余文档与源码后再运行。

注意事项

  • README 未提供 pip、训练或合成脚本的具体命令,上面步骤仅依据其 Requirements 与 Data 章节整理。
  • 数据集需自行从 README 给出的链接下载,仓库不附带音频数据。
  • 项目基于 TensorFlow 1.x 时代的 API(含 tf.contrib),在新版 TensorFlow 上可能无法直接运行,建议使用匹配版本的 Python 与 TensorFlow 环境。

核心亮点

  • 基于卷积网络和引导注意力,训练效率高,无需复杂循环网络
  • 提供预训练模型和在线合成演示,开箱即用体验效果
  • 代码结构简单,依赖少,易于阅读和二次开发

不足之处

  • 项目已停止维护,可能不兼容新版 TensorFlow
  • 语音自然度和音质相比 Tacotron 等现代模型有差距

适用场景

  • 学术研究:复现论文实验,学习端到端 TTS 原理
  • 教学演示:在课程中展示文本转语音的基本流程
  • 轻量级原型:快速搭建 TTS 概念验证系统

替代项目

Tacotron 2、FastSpeech、ESPnet-TTS

项目介绍

dc_tts 是音频音乐领域的开源项目,由 Kyubyong 开发,2017 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,159)位列前 30%,在音频音乐分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-05。Apache-2.0 许可证,可自由使用,无付费版本。

它主要面向的使用场景是:学术研究:复现论文实验,学习端到端TTS原理。同类可对比的替代方案包括 Tacotron 2、FastSpeech、ESPnet-TTS。

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09