FastSpeech2 是音频音乐领域的开源项目,由 rishikksh20 开发,2019 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 237。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-05-20。Apache-2.0许可证,可免费使用和修改,无付费版本。
它主要面向的使用场景是:快速原型验证TTS效果。同类可对比的替代方案包括 Tacotron2、ESPnet-TTS、Coqui TTS。

并行合成高质量语音,速度飞快,效果自然
FastSpeech2 是一个基于 PyTorch 的端到端文本转语音(TTS)实现,源自微软提出的 FastSpeech 2 模型。它解决了传统自回归 TTS 模型(如 Tacotron)合成速度慢、稳定性差的问题,通过非自回归的前馈网络并行生成梅尔频谱,显著提升推理速度。核心能力包括:引入 duration predictor 预测音素时长,解决对齐问题;使用 variance adaptor 建模音高、能量等韵律特征,提升语音自然度;支持多说话人训练,可扩展至多语言。该项目提供了完整的训练和推理流程,适合研究者和开发者快速复现和定制 TTS 系统。代码结构清晰,依赖较少,易于上手,是学习现代非自回归 TTS 的优秀参考实现。
Tacotron2、ESPnet-TTS、Coqui TTS
FastSpeech2 是音频音乐领域的开源项目,由 rishikksh20 开发,2019 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 237。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-05-20。Apache-2.0许可证,可免费使用和修改,无付费版本。
它主要面向的使用场景是:快速原型验证TTS效果。同类可对比的替代方案包括 Tacotron2、ESPnet-TTS、Coqui TTS。
上一篇:Talkify
下一篇:voicenotify
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK: An Open-Source Foundational Model for Speech Generation and Editing
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···