deepvoice3_pytorch

用 PyTorch 复现百度 Deep Voice 3,快速训练文本转语音模型

deepvoice3_pytorch 是百度 Deep Voice 3 文本转语音(TTS)模型的 PyTorch 非官方实现。Deep Voice 3 是一种基于卷积神经网络的全卷积 TTS 模型,能够将文本转换为自然语音。该项目解决了传统 TTS 模型训练速度慢、结构复杂的问题,通过全卷积架构实现并行化训练,显著提升效率。核心能力包括:支持多说话人建模、注意力机制、以及端到端的声学特征预测。代码基于 PyTorch 构建,提供训练和推理脚本,并支持自定义数据集。尽管原始论文已发布,但该实现为研究者提供了可复现的基线,便于进一步实验和开发。项目在 GitHub 上有近 2000 星标,属于成长中的社区项目,适合对 TTS 感兴趣的开发者学习和二次开发。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1975
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队r9y9
所属国家
定价模式free
价格说明开源项目,本地部署,完全免费。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型end-to-end,machine-learning,multi-speaker,python,pytorch,speech-processing,speech-synthesis,tts
GitHub 星标★ 1975
30天Star增速
HF 下载量
上线时间2017-10-31 00:00:00
最近更新2026-09-01 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 10 分钟 部署方式:库/依赖 4 步

环境要求

  • Python 环境(含 pip,用于 pip install -e 安装)
  • Git(用于克隆仓库)
  • README 中列出的前置依赖包(节选未给出具体清单,需回原仓库确认)
  • 可选:能访问 Google Colab 的浏览器,用于官方在线 Demo

安装与启动步骤

  1. 1克隆项目仓库

    从 GitHub 拉取源码并进入项目目录,后续安装命令需在该目录内执行。

    git clone https://github.com/r9y9/deepvoice3_pytorch && cd deepvoice3_pytorch
  2. 2安装前置依赖

    README 要求先安装其上文列出的依赖包,再装本项目;节选未给出清单,请回原仓库对照安装。

  3. 3安装项目本体

    以可编辑模式安装项目并附带 bin 依赖,这是 README 给出的正式安装命令。

    pip install -e ".[bin]"
  4. 4在线试用 Demo

    不想本地部署可打开官方 Colab Notebook,直接体验多说话人与单说话人 TTS。

关键配置

配置项必填说明示例
MPLBACKEND否切换 matplotlib 后端,用于规避主线程报错问题Qt5Agg

如何确认成功

执行 pip install -e ".[bin]" 无报错即安装完成;效果可用官方 Colab Demo 验证。

常见问题

Q:运行时报 RuntimeError: main thread is not in main loop 怎么办?

A:这是 matplotlib 后端引起的问题,可在命令前加环境变量 MPLBACKEND=Qt5Agg,例如 MPLBACKEND=Qt5Agg python train.py,把后端从 Tkinter 换成 PyQt5 即可解决。

Q:不想本地安装,能直接在浏览器里体验吗?

A:可以。README 提供两个跑在 Google Colab 上的官方 Notebook:多说话人 TTS Demo 与单说话人 TTS Demo,点开即可运行。

Q:需要先装哪些依赖包?

A:README 明确要求先安装其上文列出的包,再执行项目安装命令;但本处节选未包含该清单,请到原仓库 README 对照安装。

Q:训练脚本怎么传参数?

A:README 只给出 MPLBACKEND=Qt5Agg python train.py ${args...} 的示例形式,具体参数需查看原仓库说明,不要照抄占位符。

注意事项

  • 务必先安装 README 顶部列出的依赖包,再执行 pip install -e ".[bin]"。
  • 本教程依据的 README 节选未给出依赖清单、参数与端口,缺失部分请以原仓库为准。
  • 预训练模型与音频样例可在官网 https://r9y9.github.io/deepvoice3_pytorch/ 查看。

核心亮点

  • 全卷积架构,训练并行度高,比 RNN 类 TTS 更快
  • 支持多说话人,可扩展音色
  • 代码结构清晰,附带预训练模型和示例,易于上手

不足之处

  • 非官方实现,与论文细节可能略有差异
  • 依赖特定版本库,环境配置稍复杂
  • 文档/社区待观察

适用场景

  • 学术研究:复现基线 TTS 模型
  • 个人开发者快速搭建 TTS 原型
  • 教学演示:理解卷积 TTS 原理

替代项目

Tacotron2、FastSpeech、ESPnet-TTS

项目介绍

deepvoice3_pytorch 是音频音乐领域的开源项目,由 r9y9 开发,2017 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,975)位列前 30%,在音频音乐分类的 738 个项目里位列前 11%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-01。本地部署,完全免费。

它主要面向的使用场景是:学术研究:复现基线TTS模型。同类可对比的替代方案包括 Tacotron2、FastSpeech、ESPnet-TTS。

上一篇:KAN-TTS

下一篇:OpenAI-Audiobook-Generator

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09