TFGAN
开源
融合时频域GAN,生成高保真语音
TFGAN 是一个基于生成对抗网络(GAN)的高保真语音合成开源项目,核心创新在于同时利用时域和频域信···
汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。
共收录 738 个开源项目
TFGAN
开源
融合时频域GAN,生成高保真语音
TFGAN 是一个基于生成对抗网络(GAN)的高保真语音合成开源项目,核心创新在于同时利用时域和频域信···
zhtts
开源
CPU 上实时合成中文语音,无需显卡也能跑
zhtts 是一个基于 Python 的中文实时语音合成系统演示项目,专注于在 CPU 上实现低延迟的文本转语音···
Tacotron
开源
长文本语音合成不掉字,PyTorch 实现 Tacotron
Tacotron 是一个基于 PyTorch 实现的端到端文本转语音(TTS)系统,专注于长句语音合成的鲁棒性。它···
FastSpeech2
开源
用 PyTorch 快速实现多说话人语音合成,训练推理都省心
FastSpeech2 是一个基于 PyTorch 的多说话人端到端文本转语音(TTS)开源实现,源自微软提出的 Fas···
CycleGAN-VC3
开源
无需平行语料,一键转换声音风格
CycleGAN-VC3 是一个基于 CycleGAN 的语音转换(Voice Conversion)开源项目,旨在将一个人的声音转···
LVCNet
开源
用位置可变卷积,让语音合成又快又自然
LVCNet 是一个面向语音合成(TTS)场景的高效声码器(vocoder),由韩国团队在 ICASSP 2021 提出。···
hifi-gan
开源
让语音合成又快又真,实时生成高保真音频
HiFi-GAN 是一个基于生成对抗网络的高保真语音合成声码器,由韩国首尔大学团队开发。它解决了传统神···
TextToTalk
开源
游戏聊天自动朗读,解放双眼,不错过任何重要信息。
TextToTalk 是一个专为《最终幻想14》游戏打造的 Dalamud 插件,它能够将游戏内的聊天文本实时转换···
DNN-HSMM
开源
用 DNN+HSMM 打造更自然的语音合成声学模型
DNN-HSMM 是一个基于 PyTorch 实现的语音合成(TTS)工具,核心是将深度神经网络(DNN)与隐半马尔···
diffwave
开源
用扩散模型快速生成高保真语音波形,让 TTS 更自然高效。
DiffWave 是一个基于扩散概率模型的神经声码器与波形合成器,由 Google Brain 团队提出,用于从梅尔···
wavegrad
开源
几步生成高保真语音,比 WaveNet 快几十倍
WaveGrad 是一个基于分数匹配的快速高质量神经声码器,由 Google Research 提出,用于从梅尔频谱图···
silero-models
开源
几行代码实现高质量语音合成与识别,CPU也能跑
Silero Models 是一个提供预训练语音模型的集合,专注于让文本转语音(TTS)和语音识别(STT)变得···
WaveGrad
开源
用扩散模型快速生成高保真语音波形,一步到位
WaveGrad 是 Google Brain 提出的高保真语音合成声码器(vocoder)的 PyTorch 非官方实现。它基于扩···
dectalk
开源
让 90 年代经典 DECtalk 语音在现代电脑上重新发声
dectalk 项目旨在为 90 年代/00 年代的 DECtalk 文本转语音(TTS)应用提供现代化构建。DECtalk 是···
dla
开源
一站式音频深度学习工具箱,快速搞定语音识别与合成
dla 是一个面向音频处理的深度学习开源项目,旨在为音频相关任务提供一套完整的解决方案。它涵盖了···
TensorVox
开源
本地离线跑神经语音合成,低延迟高隐私,桌面即用
TensorVox 是一个用 C++ 编写的桌面端神经语音合成应用,专注于将文本实时转换为自然语音。它解决了···
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
swift-tts 是一个面向 Swift 开发者的轻量级文本转语音(TTS)封装库,基于 AVFoundation 的 AVSpe···
TTS-recipes
开源
一键跑通多种数据集的 TTS 训练配方,快速上手语音合成。
TTS-recipes 是一个面向不同数据集的文本转语音(TTS)训练配方集合,基于 Coqui AI 生态构建。它解···
VocGAN
开源
让语音合成更自然、更快速,实时生成高保真声音。
VocGAN 是一个基于生成对抗网络(GAN)的高保真实时声码器,专为语音合成和文本转语音(TTS)系统设···
ha-rhvoice
开源
在 Home Assistant 中本地离线生成语音,保护隐私免云端。
ha-rhvoice 是一个 Home Assistant 集成组件,用于接入 RHVoice 本地文本转语音(TTS)引擎。它解决···
Music-SketchNet
开源
画个音乐草图,AI帮你生成完整旋律和节奏
Music-SketchNet 是一个基于 ISMIR 2020 论文的开源项目,旨在通过分解音高和节奏的表征来实现可控···
vietTTS
开源
让应用开口说越南语,开箱即用的高质量 TTS 库
vietTTS 是一个专注于越南语的开源文本转语音(TTS)库,基于深度学习技术构建。它解决了越南语语音···
Crystal
开源
用 C++ 打造统一多语言 TTS 引擎,SSML 接口即插即用
Crystal 是一个基于 C++ 实现的多语言文本转语音(TTS)合成引擎,以 SSML 规范作为统一接口。它旨···
text-to-speech
开源
在 Capacitor 应用里一行代码实现文字转语音
这是一个 Capacitor 社区官方的文本转语音(TTS)插件,用于在 Capacitor 混合应用(支持 Android ···