IMS-Toucan
开源
一键生成7000种语言的自然语音,还能控制情感和语速
IMS-Toucan 是一个基于 PyTorch 的可控且快速的文本转语音(TTS)工具包,声称支持超过 7000 种语言···
汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。
共收录 738 个开源项目
IMS-Toucan
开源
一键生成7000种语言的自然语音,还能控制情感和语速
IMS-Toucan 是一个基于 PyTorch 的可控且快速的文本转语音(TTS)工具包,声称支持超过 7000 种语言···
EbookReader
开源
一个App搞定十余种电子书格式,还能听书
EbookReader 是一款开源的 Android 电子书阅读器应用,旨在解决多格式阅读和听书需求。它支持 epub···
univnet
开源
用GAN声码器,实时合成高质量语音波形
UnivNet是一个基于GAN的神经网络声码器,用于从声学特征(如梅尔频谱)合成高质量语音波形。它由韩···
UnityTTS
开源
在 Unity 里一键让文字开口说话,快速集成 TTS 功能。
UnityTTS 是一个专为 Unity 引擎设计的文本转语音(TTS)解决方案,旨在帮助开发者轻松地在 Unity ···
ubisoft-laforge-daft-exprt
开源
把一个人的说话情绪,无缝搬到另一个人声音里
Daft-Exprt 是育碧旗下 La Forge 团队开源的一个跨说话人韵律迁移工具,用于 expressive speech sy···
MuseMorphose
开源
上传 MIDI,一键转换音乐风格,保留旋律。
MuseMorphose 是一个基于 PyTorch 实现的音乐风格迁移模型,论文发表于 IEEE/ACM TASLP。它利用 Tr···
VAENAR-TTS
开源
用VAE+非自回归框架,让语音合成更快更稳
VAENAR-TTS 是一个基于 PyTorch 的非自回归文本转语音(TTS)合成实现,核心思路是结合变分自编码器···
StyleSpeech
开源
一条参考音频,快速克隆说话风格,合成自然语音
StyleSpeech 是 Meta-StyleSpeech 和 StyleSpeech 论文的官方实现,专注于语音合成(TTS)中的风格···
wavegrad2
开源
用扩散模型直接生成高保真语音波形,一步到位
WaveGrad2 是一个非官方的 PyTorch 实现,基于 Google 提出的 WaveGrad 2 模型,用于高质量语音合成···
apple_airplayer
开源
把 AirPlay 音箱变成会说话的 TTS 喇叭
apple_airplayer 是一个将 AirPlay 设备(如 HomePod、Apple TV)转换为文本转语音(TTS)扬声器的···
FastPitchFormant
开源
分解音高与音色,让语音合成控制更精细
FastPitchFormant 是 NCSOFT 提出的 FastPitchFormant 模型的 PyTorch 非官方实现,该模型基于源-滤···
ttslearn
开源
跟着示例学 TTS,从信号处理到神经语音合成
ttslearn 是一个面向 Python 学习者的语音合成(Text-to-Speech)教学库,由日本学者开发,配套书籍···
WaveGrad2
开源
用分数匹配迭代精炼,快速生成高保真语音波形
WaveGrad2 是谷歌大脑团队提出的 WaveGrad 2 模型的非官方 PyTorch 实现,专注于文本到语音(TTS)···
Fre-GAN-pytorch
开源
用 GAN 生成频率更真实的语音,提升 TTS 听感
Fre-GAN-pytorch 是 Fre-GAN 论文的 PyTorch 非官方实现,Fre-GAN 是一种基于对抗生成网络的音频合···
UnivNet-pytorch
开源
用PyTorch复现UnivNet声码器,快速生成高保真语音波形。
UnivNet-pytorch 是 UnivNet 神经声码器的非官方 PyTorch 实现。UnivNet 是一种用于高保真波形生成···
text-to-speech-api
开源
几行代码接入 Play.ht 语音合成,快速实现文本朗读
这是一个基于 Play.ht 服务的文本转语音 API 封装项目,旨在为开发者提供简单、高效的语音合成接口···
StyleSpeech
开源
一条参考语音,即刻克隆任意音色,快速合成个性化语音。
StyleSpeech 是 Meta-StyleSpeech 的 PyTorch 非官方实现,旨在解决多说话人自适应文本转语音(TTS···
MsEdgeTTS
开源
免密钥免费调用 Edge 高质量语音合成,几行代码集成 TTS
MsEdgeTTS 是一个基于 TypeScript 的轻量级文本转语音(TTS)模块,它巧妙地复用了 Microsoft Edge···
DiffSinger
开源
用扩散模型精修歌声合成,让非自回归 TTS 音质更自然
DiffSinger 是一个基于 PyTorch 的开源歌声合成(Singing Voice Synthesis)项目,核心思想是将浅层···
vits
开源
文字进、语音出,又快又自然,配音效率翻倍
VITS 采用条件变分自编码器与对抗训练实现端到端文本转语音。在保持高自然度的同时大幅简化合成流程···
mlp-singer
开源
用纯MLP快速合成韩语歌声,告别慢速自回归。
MLP Singer 是一个基于多层感知机(MLP)的韩语歌声合成(Singing Voice Synthesis)开源项目,对应···
Catch-A-Waveform
开源
给一段短音频,生成同风格无限续写
Catch-A-Waveform 是 NeurIPS 2021 论文的官方 PyTorch 实现,旨在解决从单个极短音频样本(如几秒···
edge-tts
开源
免密钥调用微软 Edge 语音,几行代码生成自然 MP3
edge-tts 是一个 Python 库,让你无需安装 Microsoft Edge、Windows 或申请 API key,就能直接调用···
Parallel-Tacotron2
开源
让语音合成告别逐字生成,并行提速数十倍
Parallel-Tacotron2 是 Google Parallel Tacotron 2 的 PyTorch 非官方实现,旨在解决传统自回归 T···