awesome-tts-samples
开源
边听边看论文,快速对比各家TTS语音效果
awesome-tts-samples 是一个精心整理的文本转语音(TTS)学术论文精选列表,核心特色是每篇论文都配···
汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。
共收录 738 个开源项目
awesome-tts-samples
开源
边听边看论文,快速对比各家TTS语音效果
awesome-tts-samples 是一个精心整理的文本转语音(TTS)学术论文精选列表,核心特色是每篇论文都配···
TTS
开源
把文字变成真人语音,多语言多音色随你挑
面向文本转语音的深度学习工具包,历经研究与生产环境双重考验。支持多语言、多语音模型,提供丰富···
durian-pytorch
开源
用时长信息提升语音合成自然度,复现前沿论文
durian-pytorch 是论文《Duration Informed Attention Network for Multimodal Synthesis》的 PyTo···
glow-tts
开源
用生成流实现快速、高质量的端到端语音合成
glow-tts 是一个基于生成流(Generative Flow)的文本转语音(TTS)开源项目,由蒙特利尔大学等机构···
TTS-papers
开源
按图索骥,快速掌握TTS研究脉络
TTS-papers 是一个收集文本转语音(TTS)领域学术论文的仓库,旨在为研究人员和开发者提供系统性的···
CycleGAN-VC2
开源
无需平行语料,一键实现音色转换
CycleGAN-VC2 是一个基于 CycleGAN 的语音转换(Voice Conversion)开源项目,旨在实现无需平行语料···
Voice-synthesis
开源
几秒音频克隆声音,实时生成语音
Voice-synthesis 是一个基于 SV2TTS(说话人验证到多说话人语音合成)框架的实时语音合成实现,包含···
dl-for-emo-tts
开源
照着跑一遍,快速上手情感语音合成实验
这是一个关于情感语音合成(Emotional Text-to-Speech)的深度学习实验总结项目,以Jupyter Notebo···
WG-WaveNet
开源
无 GPU 也能实时生成高保真语音,让语音合成摆脱硬件束缚。
WG-WaveNet 是一个基于 Python 的实时高质量语音合成项目,其核心卖点是在没有 GPU 的条件下实现高···
DeepLearningMusicGeneration
开源
一张图看懂AI音乐生成前沿,快速上手深度学习方法
DeepLearningMusicGeneration 是一个专注于深度学习音乐生成领域的开源项目,旨在汇总和展示当前最···
Cross-Lingual-Voice-Cloning
开源
用一段语音样本,跨语言克隆你的声音
这是一个基于PyTorch的Tacotron 2实现,专注于跨语言语音克隆。它解决了传统语音合成系统只能使用单···
pitchtron
开源
让韩语方言TTS说对音调,不再怪腔怪调
pitchtron 是一个面向韩语等声调语言的文本转语音(TTS)工具,专注于处理韩语方言中的音高重音(p···
TransformerTTS
开源
用 Transformer 并行合成语音,告别逐字慢速生成
TransformerTTS 是一个基于非自回归 Transformer 架构的文本转语音(TTS)开源实现,由 Axel Sprin···
TensorFlowTTS
开源
用 TensorFlow 2 快速构建多语言实时语音合成系统
TensorFlowTTS 是一个基于 TensorFlow 2 的实时语音合成工具包,旨在提供最先进的语音合成能力。它···
muspy
开源
一站式搞定符号音乐生成的数据、评估与可视化
MusPy 是一个用于符号音乐生成的开源 Python 工具包,旨在为音乐生成研究和应用提供统一、高效的基···
DeepMusicvStyle
开源
指定风格,一键生成对应旋律的 MIDI 音乐
DeepMusicvStyle 是 ICME 2020 论文《Style-Conditioned Music Generation》的官方代码仓库,实现了···
Parakeet
开源
用 PaddlePaddle 一键训练和部署多种主流语音合成模型
Parakeet 是百度 PaddlePaddle 生态下的并行语音合成工具包,旨在提供从文本到语音的完整训练与推理···
remi
开源
用 Transformer 生成有节奏感的流行钢琴曲,基于节拍建模更自然。
Remi 是一个基于 Transformer 的流行钢琴音乐生成工具,源自 ACM Multimedia 2020 论文。它解决了传···
resemble-unity-text-to-speech
开源
在Unity里一键接入克隆人声,让角色开口说话
Resemble Unity Text-to-Speech 是 Resemble AI 官方推出的 Unity 插件,将先进的语音克隆引擎无缝···
Voice-Privacy-Challenge-2020
开源
一键匿名化语音,保护说话人身份,同时保留内容可懂度。
Voice-Privacy-Challenge-2020 是语音隐私挑战赛的官方基线方案,旨在解决语音数据中的说话人身份泄···
wsay
开源
在 Windows 命令行里,一句话让电脑开口说话
wsay 是一个 Windows 平台下的命令行文本转语音(TTS)工具,相当于 macOS 上 `say` 命令的 Window···
nonparaSeq2seqVC_code
开源
无需平行语料,实现任意说话人语音转换
这是一个基于非平行语料库的序列到序列语音转换(Voice Conversion, VC)实现代码。传统语音转换通···
bangla-tts
开源
让孟加拉语文本瞬间变语音,多语言实时合成轻松搞定
bangla-tts 是一个专注于孟加拉语(Bangla)的文本转语音(TTS)库,同时支持孟加拉语和英语的多语···
MusicTransformer-Pytorch
开源
用 PyTorch 复现 Music Transformer,轻松生成连贯钢琴曲
MusicTransformer-Pytorch 是一个基于 PyTorch 框架实现的音乐生成项目,针对 MaestroV2 数据集编写···