FastSpeech2

并行合成高质量语音,速度飞快,效果自然

FastSpeech2 是一个基于 PyTorch 的端到端文本转语音(TTS)实现,源自微软提出的 FastSpeech 2 模型。它解决了传统自回归 TTS 模型(如 Tacotron)合成速度慢、稳定性差的问题,通过非自回归的前馈网络并行生成梅尔频谱,显著提升推理速度。核心能力包括:引入 duration predictor 预测音素时长,解决对齐问题;使用 variance adaptor 建模音高、能量等韵律特征,提升语音自然度;支持多说话人训练,可扩展至多语言。该项目提供了完整的训练和推理流程,适合研究者和开发者快速复现和定制 TTS 系统。代码结构清晰,依赖较少,易于上手,是学习现代非自回归 TTS 的优秀参考实现。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 237
维护状态 低维护
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队rishikksh20
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和修改,无付费版本。
访问状态
是否开源
开源协议Apache-2.0
主要语言Jupyter Notebook
技术栈/模型fastspeech,fastspeech2,pytorch,text-to-speech,tts,tts-engines
GitHub 星标★ 237
30天Star增速
HF 下载量
上线时间2019-11-16 00:00:00
最近更新2026-05-20 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 非自回归架构,合成速度比自回归模型快数倍
  • 显式建模音高和能量,语音表现力更强
  • 代码简洁,依赖少,易于复现和二次开发

不足之处

  • 文档和示例较少,新手配置环境可能费劲
  • 仅支持单一说话人训练,多说话人需自行扩展

适用场景

  • 快速原型验证 TTS 效果
  • 研究非自回归 TTS 架构
  • 构建低延迟语音合成服务

替代项目

Tacotron2、ESPnet-TTS、Coqui TTS

项目介绍

FastSpeech2 是音频音乐领域的开源项目,由 rishikksh20 开发,2019 年首次发布。

它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 237。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-05-20。Apache-2.0许可证,可免费使用和修改,无付费版本。

它主要面向的使用场景是:快速原型验证TTS效果。同类可对比的替代方案包括 Tacotron2、ESPnet-TTS、Coqui TTS。

上一篇:Talkify

下一篇:voicenotify

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09