BVAE-TTS 是音频音乐领域的开源项目,由 LEEYOONHYUNG 开发,2021 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 173。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2024-11-03。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:学术研究:作为TTS生成模型的新基线对比实验。同类可对比的替代方案包括 Tacotron2、FastSpeech2、VITS。

用贝叶斯变分自编码器生成更自然多样的语音
BVAE-TTS 是一个基于 PyTorch 的文本转语音(TTS)开源项目,是论文的官方实现。它采用贝叶斯变分自编码器(BVAE)框架,旨在解决传统 TTS 模型中潜在表示不连续、生成语音多样性不足的问题。核心能力包括:通过变分推断学习稳健的潜在空间,提升语音的自然度和表现力;支持多说话人建模,可生成不同音色的语音;提供完整的训练和推理流程,方便研究者复现和扩展。项目代码结构清晰,依赖简洁,适合作为 TTS 领域的研究基线和实验平台。目前处于早期阶段,星标数不高,但技术路线具有创新性,适合关注生成式语音模型的开发者。
Tacotron2、FastSpeech2、VITS
BVAE-TTS 是音频音乐领域的开源项目,由 LEEYOONHYUNG 开发,2021 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 173。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2024-11-03。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:学术研究:作为TTS生成模型的新基线对比实验。同类可对比的替代方案包括 Tacotron2、FastSpeech2、VITS。
上一篇:elevenlabs-node
下一篇:wsay
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK: An Open-Source Foundational Model for Speech Generation and Editing
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···