non-autoregressive
本站收录 16 个带「non-autoregressive」标签的 AI 开源项目
Matcha-TTSMatcha-TTS 是一个基于条件流匹配(Conditional Flow Matching)的快速文本转语音(TTS)架构,发表于 ICASSP 2024。★ 1,362
StreamSpeechStreamSpeech 是一个“一体化”的无缝语音模型,同时支持离线与同声传译场景下的语音识别(ASR)、语音翻译和语音合成。它解决了传统级联系统延迟高、错误★ 1,294
DiffGAN-TTSDiffGAN-TTS 是一个基于 PyTorch 的文本转语音(TTS)实现,核心思想是结合扩散模型(Diffusion)和生成对抗网络(GAN),在保证高保★ 349
PortaSpeechPortaSpeech 是一个基于 PyTorch 的非自回归文本转语音(TTS)实现,源自论文《PortaSpeech: Portable and High-★ 341
Comprehensive-Transformer-TTS这是一个基于非自回归Transformer的文本转语音(TTS)项目,集成了多种SOTA Transformer架构,并支持有监督和无监督两种时长建模方式。它解★ 327
Expressive-FastSpeech2Expressive-FastSpeech2 是一个基于 PyTorch 的非自回归表达性语音合成(TTS)开源项目,在 FastSpeech2 基础上扩展了情★ 324
DailyTalkDailyTalk 是 ICASSP 2023 论文的官方实现,提供了一个面向对话场景的语音合成数据集和配套的非自回归 TTS 模型。它解决了传统 TTS 只能★ 262
DiffSingerDiffSinger 是一个基于 PyTorch 的开源歌声合成(Singing Voice Synthesis)项目,核心思想是将浅层扩散机制(Shallow★ 247
StyleSpeechStyleSpeech 是 Meta-StyleSpeech 的 PyTorch 非官方实现,旨在解决多说话人自适应文本转语音(TTS)中需要大量参考音频的问题★ 198
Cross-Speaker-Emotion-Transfer这是一个基于PyTorch实现的跨说话人情感迁移语音合成项目,源自字节跳动的研究成果。它解决的核心问题是:在文本到语音(TTS)合成中,如何让一个说话人的声音表★ 193
Parallel-Tacotron2Parallel-Tacotron2 是 Google Parallel Tacotron 2 的 PyTorch 非官方实现,旨在解决传统自回归 TTS 模型★ 191
Comprehensive-E2E-TTS这是一个基于 PyTorch 的非自回归端到端文本转语音(TTS)项目,直接将文本转换为语音波形,无需中间声学特征。它集成了多种前沿的无监督时长建模方法,支持 ★ 147
FastPitchFormantFastPitchFormant 是 NCSOFT 提出的 FastPitchFormant 模型的 PyTorch 非官方实现,该模型基于源-滤波器(sour★ 74
VAENAR-TTSVAENAR-TTS 是一个基于 PyTorch 的非自回归文本转语音(TTS)合成实现,核心思路是结合变分自编码器(VAE)与非自回归生成框架,旨在解决传统自★ 74
WaveGrad2WaveGrad2 是谷歌大脑团队提出的 WaveGrad 2 模型的非官方 PyTorch 实现,专注于文本到语音(TTS)合成。它采用非自回归架构,通过迭代★ 68
Daft-ExprtDaft-Exprt 是一个基于 PyTorch 的非自回归语音合成模型,专注于跨说话人的韵律迁移,旨在解决 expressive TTS 中韵律风格难以从源说★ 55