Tacotron 是音频音乐领域的开源项目,由 bshall 开发,2020 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 115。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-03-12。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:研究TTS注意力机制改进。同类可对比的替代方案包括 Tacotron2、FastSpeech、ESPnet-TTS。

长文本语音合成不掉字,PyTorch 实现 Tacotron
Tacotron 是一个基于 PyTorch 实现的端到端文本转语音(TTS)系统,专注于长句语音合成的鲁棒性。它实现了位置相对注意力机制(Location-Relative Attention),解决了传统注意力在长文本合成时容易出现的对齐漂移和重复/漏读问题。项目包含完整的训练和推理流程,支持从文本到 Mel 频谱图的直接生成,并可与声码器(如 WaveGlow)配合输出最终音频。核心能力包括:位置相对注意力、动态衰减惩罚、多步注意力等,适用于长段落、多句子的语音合成场景。作为早期研究实现,代码结构清晰,适合学习和二次开发。
Tacotron2、FastSpeech、ESPnet-TTS
Tacotron 是音频音乐领域的开源项目,由 bshall 开发,2020 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 115。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-03-12。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:研究TTS注意力机制改进。同类可对比的替代方案包括 Tacotron2、FastSpeech、ESPnet-TTS。
上一篇:ElevenLabs-Clone
下一篇:TTS-RVC-API
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK: An Open-Source Foundational Model for Speech Generation and Editing
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···