tacotron

听Tacotron合成语音,感受端到端TTS的早期突破

Tacotron是Google提出的端到端语音合成模型,该项目是其论文的音频样本展示页。它解决了传统TTS系统需要复杂前端文本分析和声学建模的问题,直接通过注意力机制将字符序列映射为线性频谱,再经Griffin-Lim或WaveNet声码器合成语音。核心能力包括:支持多说话人、可控的韵律和情感表达、接近自然的语音质量。项目本身不包含训练代码,但提供了丰富的音频样例,是研究TTS发展的重要参考。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 539
维护状态 低维护
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队google
所属国家
定价模式free
价格说明开源项目,提供音频样本和代码,完全免费。
访问状态
是否开源
开源协议NOASSERTION
主要语言HTML
技术栈/模型audio,machine-learning,prosody,speech,tacotron,tts
GitHub 星标★ 539
30天Star增速
HF 下载量
上线时间2017-03-20 00:00:00
最近更新2026-07-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 提供大量真实合成音频,直观感受模型效果
  • 涵盖多说话人和韵律控制样例,展示模型能力
  • 作为经典TTS模型,是理解端到端语音合成的重要学习资源

不足之处

  • 仅音频样本,无训练代码和推理实现
  • 文档/社区待观察

适用场景

  • 研究端到端TTS发展历程,对比早期模型效果
  • 教学演示,展示注意力机制在语音合成中的应用
  • 为TTS产品选型提供效果参考

替代项目

Tacotron2、FastSpeech、WaveNet

项目介绍

tacotron 是音频音乐领域的开源项目,由 google 开发,2017 年首次发布。

它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 539。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-07-21。提供音频样本和代码,完全免费。

它主要面向的使用场景是:研究端到端TTS发展历程,对比早期模型效果。同类可对比的替代方案包括 Tacotron2、FastSpeech、WaveNet。

上一篇:Kazakh_TTS

下一篇:podcast-llm

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09