FastSpeech2 是音频音乐领域的开源项目,由 ga642381 开发,2020 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 99。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-02-25。可自行部署使用,完全免费。
它主要面向的使用场景是:学术研究:复现FastSpeech2论文,对比非自回归TTS效果。同类可对比的替代方案包括 Coqui TTS、ESPnet-TTS、Tacotron2。

用 PyTorch 快速实现多说话人语音合成,训练推理都省心
FastSpeech2 是一个基于 PyTorch 的多说话人端到端文本转语音(TTS)开源实现,源自微软提出的 FastSpeech2 模型。它解决了传统自回归 TTS 模型(如 Tacotron2)推理速度慢、鲁棒性差的问题,通过非自回归的前馈网络并行生成梅尔频谱,显著提升合成速度。项目核心能力包括:支持多说话人训练与合成,可扩展音色;提供 MelGAN 和 WaveGlow 两种声码器选项,兼顾合成质量与速度;内置音素时长预测、能量和音高预测模块,使语音更自然、富有表现力。代码结构清晰,便于研究者复现和二次开发,适合作为 TTS 入门或实验基线。
Coqui TTS、ESPnet-TTS、Tacotron2
FastSpeech2 是音频音乐领域的开源项目,由 ga642381 开发,2020 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 99。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-02-25。可自行部署使用,完全免费。
它主要面向的使用场景是:学术研究:复现FastSpeech2论文,对比非自回归TTS效果。同类可对比的替代方案包括 Coqui TTS、ESPnet-TTS、Tacotron2。
下一篇:AdaSpeech
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK: An Open-Source Foundational Model for Speech Generation and Editing
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···