ParallelWaveGAN

一站式 PyTorch 声码器集合,快速生成高保真语音波形。

ParallelWaveGAN 是一个基于 PyTorch 的非官方实现,集成了多种主流神经声码器,包括 Parallel WaveGAN、MelGAN、多频带 MelGAN、HiFi-GAN 和 StyleMelGAN。它解决了语音合成中从频谱特征生成高质量原始波形的问题,即声码器环节。该项目提供统一的训练和推理流程,支持实时合成,并附带预训练模型。其核心能力在于高效生成自然、高保真的语音波形,适用于文本到语音(TTS)系统。通过对比多种声码器,研究者可以方便地评估和选择适合的模型。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1645
维护状态 低维护
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队kan-bayashi
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言Jupyter Notebook
技术栈/模型hifigan,melgan,neural-vocoder,parallel-wavenet,pytorch,realtime,speech-synthesis,style-melgan,text-to-speech,tts,vocoder,wavenet
GitHub 星标★ 1645
30天Star增速
HF 下载量
上线时间2019-10-29 00:00:00
最近更新2026-09-11 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 6 步

环境要求

  • Python 环境(建议使用 conda 或 virtualenv 虚拟环境)
  • PyTorch(项目通过 tools/Makefile 指定 CUDA 版本编译安装)
  • 如需分布式训练需额外编译安装 apex
  • make 工具(用于执行 Makefile 安装流程)

安装与启动步骤

  1. 1克隆仓库

    从 GitHub 拉取 ParallelWaveGAN 源码,进入项目根目录后再执行后续安装步骤。

    git clone https://github.com/kan-bayashi/ParallelWaveGAN.git
    cd ParallelWaveGAN
  2. 2执行安装

    README 说明可从两种方式中选择,实际命令需查看 tools/Makefile;注意其中固定了编译 pytorch wheel 的 CUDA 版本。

    make
  3. 3可选安装 apex

    仅当需要进行分布式训练时执行,用于编译安装 apex 加速库。

    make apex
  4. 4运行 recipe

    仓库自带完整 recipe,可直接从零开始运行训练与推理流程;具体依赖需先按上文完成环境安装。

    cd egs/your_recipe/v1
    ./run.sh
  5. 5pip 方式安装

    确保 parallel_wavegan 已安装,若未安装可用 pip 直接安装该包。

    pip install parallel_wavegan
  6. 6在 ESPnet 环境中安装

    与 ESPnet-TTS 结合使用时,需在 ESPnet 的 conda 或 virtualenv 环境里升级安装 parallel_wavegan。

    . ./path.sh && pip install -U parallel_wavegan

关键配置

配置项必填说明示例
CUDA 版本决定编译安装的 pytorch wheel 版本,可修改 tools/Makefile 更换。cu102

如何确认成功

可执行 pip show parallel_wavegan 查看是否安装成功;运行 recipe 后检查输出目录是否生成模型与音频文件。

常见问题

Q:安装时想换 CUDA 版本怎么办?

A:README 指出 pytorch wheel 的 CUDA 版本固定,需要查看并修改 tools/Makefile 中对应的 pytorch wheel 配置。

Q:必须安装 apex 吗?

A:不是必须的,仅在使用分布式训练时才需要通过 make apex 安装 apex。

Q:如何与 ESPnet-TTS 一起使用?

A:先在 ESPnet 的 conda 或 virtualenv 环境中激活路径并执行 pip install -U parallel_wavegan,并确保已完成 ESPnet-TTS 的 recipe。

Q:可以直接用 pip 安装吗?

A:可以,README 说明若未安装 parallel_wavegan,可直接执行 pip install parallel_wavegan。

注意事项

  • 本仓库为非官方(UNOFFICIAL)PyTorch 实现,包含 Parallel WaveGAN、MelGAN、Multiband-MelGAN、HiFi-GAN、StyleMelGAN 五种模型。
  • 目标是与 ESPnet-TTS 兼容的实时神经声码器,也可配合 NVIDIA/tacotron2 的实现使用。
  • README 节选未给出完整安装命令细节,实际命令需参考仓库内 tools/Makefile 与各 recipe 目录。
  • 项目在 Google Colab 提供实时端到端语音合成演示,可先在线体验再本地部署。

核心亮点

  • 集成五种主流声码器,便于对比和选择
  • 提供预训练模型,开箱即用
  • 支持实时推理,适合生产部署

不足之处

  • 非官方实现,可能缺少最新优化
  • 文档/社区待观察

适用场景

  • TTS 系统后端声码器选型与评估
  • 语音合成研究中的波形生成实验
  • 实时语音交互应用开发

替代项目

HiFi-GAN、MelGAN、WaveGlow

项目介绍

ParallelWaveGAN 是音频音乐领域的开源项目,由 kan-bayashi 开发,2019 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,645)位列前 30%,在音频音乐分类的 738 个项目里位列前 12%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-11。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:TTS系统后端声码器选型与评估。同类可对比的替代方案包括 HiFi-GAN、MelGAN、WaveGlow。

上一篇:Genie-TTS

下一篇:VibeVoice-ComfyUI

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09