coqui_tts_korea
开源
用 Coqui 快速搭建韩语语音合成,开箱即用
这是一个基于 Coqui TTS 的韩语语音合成项目,使用 GlowTTS 和 Multiband MelGAN 模型实现高质量的···
汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。
共收录 738 个开源项目
coqui_tts_korea
开源
用 Coqui 快速搭建韩语语音合成,开箱即用
这是一个基于 Coqui TTS 的韩语语音合成项目,使用 GlowTTS 和 Multiband MelGAN 模型实现高质量的···
easy-speech
开源
一行代码让网页开口说话,跨浏览器无依赖
easy-speech 是一个基于 Web Speech API 的跨浏览器语音合成(TTS)库,零依赖,体积小巧。它解决了···
obsidian-tts
开源
选中笔记文字,一键朗读,解放双眼。
obsidian-tts 是一个为 Obsidian 笔记软件开发的文本转语音插件,让你直接“听”笔记内容。它解决了···
ThemeTransformer
开源
给段旋律,AI 帮你生成完整音乐作品
ThemeTransformer 是一个基于主题的音乐生成开源项目,是 IEEE TMM 论文的官方实现。它解决的核心问···
tts-now
开源
一键将文字转为自然语音,支持批量处理,跨平台免费开源
tts-now 是一款基于云平台语音合成 API 的跨平台文字转语音助手,支持阿里云、讯飞等主流 TTS 服务···
Multi-Singer
开源
从乐谱和歌词合成自然歌声,复现顶会论文效果
Multi-Singer 是 ACM MM 2021 论文的官方 PyTorch 实现,专注于歌唱语音合成(Singing Voice Synth···
D2M-GAN
开源
给舞蹈视频自动生成匹配节拍的音乐
D2M-GAN 是一个基于生成对抗网络(GAN)的跨模态音乐生成项目,发表于 ECCV 2022。它解决的核心问题···
lofi-generator
开源
用深度学习一键生成 Lo-fi 背景音乐,灵感不枯竭
lofi-generator 是一个利用深度学习技术生成 Lo-fi 风格音乐的实验性开源项目。它针对 Lo-fi 音乐创···
Cross-Speaker-Emotion-Transfer
开源
让任意声音说出带指定情感的语音,跨说话人情感迁移。
这是一个基于PyTorch实现的跨说话人情感迁移语音合成项目,源自字节跳动的研究成果。它解决的核心问···
ukrainian-tts
开源
用 ESPnet 快速训练和合成乌克兰语语音,让应用开口说乌语。
ukrainian-tts 是一个基于 ESPnet 工具包的乌克兰语文本转语音(TTS)开源项目。它主要解决乌克兰语···
Neural-HMM
开源
用神经HMM替代注意力,实现稳定高质量的语音合成
Neural-HMM 是一个基于神经隐马尔可夫模型(Neural HMM)的高质量文本转语音(TTS)开源项目。它旨···
PortaSpeech
开源
轻量级高音质语音合成,让 TTS 模型跑在移动端。
PortaSpeech 是一个基于 PyTorch 的非自回归文本转语音(TTS)实现,源自论文《PortaSpeech: Porta···
YourTTS
开源
上传几秒音频,即刻克隆声音并合成语音
YourTTS 是一个面向所有人的零样本多说话人文本转语音(TTS)和零样本语音转换(VC)开源项目。它基···
editts
开源
用扩散模型精准编辑语音,改音高语速不动原声
EdiTTS 是 INTERSPEECH 2022 论文的官方实现,基于分数生成模型(score-based)实现可控的文本到语···
hass-edge-tts
开源
免密钥接入 Edge 语音,让 Home Assistant 开口说话
hass-edge-tts 是一个专为 Home Assistant 设计的自定义 TTS 组件,利用微软 Edge 浏览器的在线语音···
vits_chinese
开源
中文语音合成更自然,支持流式输出,开箱即用
vits_chinese 是一个基于 BERT 和 VITS 的中文语音合成(TTS)最佳实践项目,融合了微软自然语音的···
voicefixer_main
开源
一键修复受损语音,让声音恢复清晰
VoiceFixer 是一个通用的语音修复工具,旨在解决语音信号中的各种退化问题,如背景噪声、混响和低质···
video-bgm-generation
开源
根据视频内容自动生成匹配的背景音乐,省时又专业
video-bgm-generation 是 ACM MM 2021 最佳论文的开源实现,旨在为视频自动生成背景音乐。它解决的···
voicefixer
开源
一键修复受损语音,去噪去混响去削波,让声音更清晰
VoiceFixer 是一个基于深度学习的通用语音修复工具,旨在恢复受损的语音信号,使其更清晰、更自然。···
ChineseTtsTflite
开源
安卓离线中文语音合成,快速测试TFLite模型
ChineseTtsTflite 是一个基于 TensorFlowTTS 的安卓离线中文语音合成引擎,主要面向 TfLite 模型测···
Comprehensive-Transformer-TTS
开源
用Transformer并行合成语音,速度飞快,效果媲美SOTA。
这是一个基于非自回归Transformer的文本转语音(TTS)项目,集成了多种SOTA Transformer架构,并支···
MidiTok
开源
把乐谱变成 AI 的口粮,喂饱它就能源源不断写歌
专为深度学习模型设计的 MIDI 与符号音乐分词器,提供多种 tokenization 策略,可将符号音乐高效转···
Daft-Exprt
开源
跨说话人迁移韵律,让合成语音更有情感
Daft-Exprt 是一个基于 PyTorch 的非自回归语音合成模型,专注于跨说话人的韵律迁移,旨在解决 exp···
MockingBird
开源
5 秒复刻一个声音,你说什么它就能说什么
只需 5 秒即可克隆一个声音,实现任意文本的实时语音合成。项目基于 PyTorch,提供训练与推理全流程···