vocoder

本站收录 33 个带「vocoder」标签的 AI 开源项目

TTS面向文本转语音的深度学习工具包,历经研究与生产环境双重考验。支持多语言、多语音模型,提供丰富的预训练模型与训练接口,既能快速搭建 TTS 服务,也能满足深入探索★ 46,083PaddleSpeechPaddleSpeech 是百度开源的端到端语音工具包,基于飞桨深度学习框架,提供从语音识别、语音合成到说话人验证、语音翻译、关键词唤醒等全链路能力。它解决了语★ 12,689AmphionAmphion 是一个面向音频、音乐和语音生成的开源工具包,旨在支持可复现研究,并帮助初级研究者和工程师快速入门。它集成了多种主流模型与算法,涵盖文本到语音(T★ 10,305TTSMozilla TTS 是一个基于深度学习的文本转语音(TTS)引擎,旨在提供高质量、自然且灵活的语音合成能力。它解决了传统 TTS 系统音质生硬、定制困难的问★ 10,172Bert-VITS2Bert-VITS2 是一个基于 VITS2 架构、引入多语言 BERT 特征的开源语音合成(TTS)项目。它解决了传统端到端 TTS 模型在多语言、多说话人场★ 8,805TensorFlowTTSTensorFlowTTS 是一个基于 TensorFlow 2 的实时语音合成工具包,旨在提供最先进的语音合成能力。它解决了从文本到语音(TTS)的完整流程问★ 3,995hifi-ganHiFi-GAN 是一个基于生成对抗网络的高保真语音合成声码器,由韩国首尔大学团队开发。它解决了传统神经声码器(如 WaveNet)推理速度慢、难以实时部署的问★ 2,372ParallelWaveGANParallelWaveGAN 是一个基于 PyTorch 的非官方实现,集成了多种主流神经声码器,包括 Parallel WaveGAN、MelGAN、多频带★ 1,646voicefixerVoiceFixer 是一个基于深度学习的通用语音修复工具,旨在恢复受损的语音信号,使其更清晰、更自然。它能够处理多种类型的语音退化,包括背景噪声、混响、削波(★ 1,381diffwaveDiffWave 是一个基于扩散概率模型的神经声码器与波形合成器,由 Google Brain 团队提出,用于从梅尔频谱等条件特征高效生成高质量语音波形。它解决★ 886FastDiffFastDiff 是一个基于 PyTorch 实现的快速音频生成模型,源自 IJCAI 2022 论文。它属于神经声码器(neural vocoder)类别,主★ 424WaveGradWaveGrad 是 Google Brain 提出的高保真语音合成声码器(vocoder)的 PyTorch 非官方实现。它基于扩散概率模型(diffusio★ 408VocGANVocGAN 是一个基于生成对抗网络(GAN)的高保真实时声码器,专为语音合成和文本转语音(TTS)系统设计。它解决的核心问题是传统声码器(如 WaveNet)★ 322wavegradWaveGrad 是一个基于分数匹配的快速高质量神经声码器,由 Google Research 提出,用于从梅尔频谱图生成原始音频波形。它解决了传统神经声码器(★ 299univnetUnivNet是一个基于GAN的神经网络声码器,用于从声学特征(如梅尔频谱)合成高质量语音波形。它由韩国团队提出,论文发表于2021年,本仓库是其非官方PyTo★ 287iSTFTNet-pytorchiSTFTNet-pytorch 是一个轻量级、快速的声码器(vocoder)实现,基于逆短时傅里叶变换(iSTFT)来加速 Mel 频谱图到波形的合成。它解决★ 281HiFTNetHiFTNet 是一个基于神经网络的声码器(vocoder),用于将声学特征(如梅尔频谱)快速合成为高质量语音波形。它针对传统神经声码器推理速度慢的问题,提出结★ 260vietTTSvietTTS 是一个专注于越南语的开源文本转语音(TTS)库,基于深度学习技术构建。它解决了越南语语音合成缺乏高质量开源方案的问题,核心能力包括:使用 Tac★ 258MSMC-TTSMSMC-TTS 是一个多阶段多码本(Multi-Stage Multi-Codebook)的语音合成(TTS)开源项目,基于深度学习与 GAN 架构,结合 V★ 168Multi-SingerMulti-Singer 是 ACM MM 2021 论文的官方 PyTorch 实现,专注于歌唱语音合成(Singing Voice Synthesis)。它★ 139Avocodo-pytorchAvocodo-pytorch 是 Avocodo 声码器的 PyTorch 实现。Avocodo 是一种基于生成对抗网络(GAN)的声码器,旨在从声学特征(如★ 122Fre-GAN-pytorchFre-GAN-pytorch 是 Fre-GAN 论文的 PyTorch 非官方实现,Fre-GAN 是一种基于对抗生成网络的音频合成声码器,旨在解决传统声码★ 113DiffWave-VocoderDiffWave-Vocoder 是一个基于 PyTorch 的 DiffWave 声码器非官方复现项目。DiffWave 是一种高质量的神经声码器,采用扩散概★ 90LVCNetLVCNet 是一个面向语音合成(TTS)场景的高效声码器(vocoder),由韩国团队在 ICASSP 2021 提出。它解决的是自回归声码器(如 WaveN★ 80magphaseMagPhase 是一个基于 Python 的开源声码器,用于语音分析与合成,主要面向文本转语音(TTS)及相关应用。它解决了传统声码器在语音自然度和计算效率之★ 80cnn_vocodercnn_vocoder 是一个基于卷积神经网络(CNN)的快速声码器(vocoder)开源项目,用 Python 实现。声码器是语音合成和音频生成中的关键组件,★ 78UnivNet-pytorchUnivNet-pytorch 是 UnivNet 神经声码器的非官方 PyTorch 实现。UnivNet 是一种用于高保真波形生成的神经声码器,通过多分辨率★ 76WG-WaveNetWG-WaveNet 是一个基于 Python 的实时高质量语音合成项目,其核心卖点是在没有 GPU 的条件下实现高保真语音生成。它通过改进 WaveNet 的★ 73LPC_for_TTSLPC_for_TTS 是一个基于 Python 的线性预测系数(LPC)估计工具,专为语音合成(TTS)场景设计。它从梅尔频谱图中提取 LPC 系数,采用 L★ 72AutoVocoderAutoVocoder 是一个基于可微数字信号处理(DDSP)的语音波形快速生成工具。它从学习到的语音表示(如音高、响度等)出发,通过可微分的声码器直接合成高质★ 71coqui_tts_korea这是一个基于 Coqui TTS 的韩语语音合成项目,使用 GlowTTS 和 Multiband MelGAN 模型实现高质量的韩语文本转语音。项目主要解决韩★ 66FFTNetFFTNet 是一个基于 FFT 的实时、说话人相关的神经声码器,用于语音合成(TTS)系统中的波形生成。它解决了传统声码器(如 WaveNet)推理速度慢、难★ 64melganMelGAN 是一个基于 GAN 的语音合成声码器(vocoder)实现,支持多频带(Multi-Band)和全频带(Full Band)两种模式。它解决的是文★ 63