音频音乐

汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。

共收录 738 个开源项目

coqui_tts_korea 开源

用 Coqui 快速搭建韩语语音合成,开箱即用

这是一个基于 Coqui TTS 的韩语语音合成项目,使用 GlowTTS 和 Multiband MelGAN 模型实现高质量的···

★ 66 评分 2021-12-07
easy-speech 开源

一行代码让网页开口说话,跨浏览器无依赖

easy-speech 是一个基于 Web Speech API 的跨浏览器语音合成(TTS)库,零依赖,体积小巧。它解决了···

★ 266 评分 2021-11-26
obsidian-tts 开源

选中笔记文字,一键朗读,解放双眼。

obsidian-tts 是一个为 Obsidian 笔记软件开发的文本转语音插件,让你直接“听”笔记内容。它解决了···

★ 123 评分 2021-11-19
ThemeTransformer 开源

给段旋律,AI 帮你生成完整音乐作品

ThemeTransformer 是一个基于主题的音乐生成开源项目,是 IEEE TMM 论文的官方实现。它解决的核心问···

★ 127 评分 2021-11-04
tts-now 开源

一键将文字转为自然语音,支持批量处理,跨平台免费开源

tts-now 是一款基于云平台语音合成 API 的跨平台文字转语音助手,支持阿里云、讯飞等主流 TTS 服务···

★ 370 评分 2021-10-27
Multi-Singer 开源

从乐谱和歌词合成自然歌声,复现顶会论文效果

Multi-Singer 是 ACM MM 2021 论文的官方 PyTorch 实现,专注于歌唱语音合成(Singing Voice Synth···

★ 139 评分 2021-10-26
D2M-GAN 开源

给舞蹈视频自动生成匹配节拍的音乐

D2M-GAN 是一个基于生成对抗网络(GAN)的跨模态音乐生成项目,发表于 ECCV 2022。它解决的核心问题···

★ 85 评分 2021-10-19
lofi-generator 开源

用深度学习一键生成 Lo-fi 背景音乐,灵感不枯竭

lofi-generator 是一个利用深度学习技术生成 Lo-fi 风格音乐的实验性开源项目。它针对 Lo-fi 音乐创···

★ 83 评分 2021-10-17
Cross-Speaker-Emotion-Transfer 开源

让任意声音说出带指定情感的语音,跨说话人情感迁移。

这是一个基于PyTorch实现的跨说话人情感迁移语音合成项目,源自字节跳动的研究成果。它解决的核心问···

★ 193 评分 2021-10-16
ukrainian-tts 开源

用 ESPnet 快速训练和合成乌克兰语语音,让应用开口说乌语。

ukrainian-tts 是一个基于 ESPnet 工具包的乌克兰语文本转语音(TTS)开源项目。它主要解决乌克兰语···

★ 249 评分 2021-10-14
Neural-HMM 开源

用神经HMM替代注意力,实现稳定高质量的语音合成

Neural-HMM 是一个基于神经隐马尔可夫模型(Neural HMM)的高质量文本转语音(TTS)开源项目。它旨···

★ 164 评分 2021-10-08
PortaSpeech 开源

轻量级高音质语音合成,让 TTS 模型跑在移动端。

PortaSpeech 是一个基于 PyTorch 的非自回归文本转语音(TTS)实现,源自论文《PortaSpeech: Porta···

★ 341 评分 2021-10-06
YourTTS 开源

上传几秒音频,即刻克隆声音并合成语音

YourTTS 是一个面向所有人的零样本多说话人文本转语音(TTS)和零样本语音转换(VC)开源项目。它基···

★ 1052 评分 2021-10-06
editts 开源

用扩散模型精准编辑语音,改音高语速不动原声

EdiTTS 是 INTERSPEECH 2022 论文的官方实现,基于分数生成模型(score-based)实现可控的文本到语···

★ 122 评分 2021-10-05
hass-edge-tts 开源

免密钥接入 Edge 语音,让 Home Assistant 开口说话

hass-edge-tts 是一个专为 Home Assistant 设计的自定义 TTS 组件,利用微软 Edge 浏览器的在线语音···

★ 488 评分 2021-09-27
vits_chinese 开源

中文语音合成更自然,支持流式输出,开箱即用

vits_chinese 是一个基于 BERT 和 VITS 的中文语音合成(TTS)最佳实践项目,融合了微软自然语音的···

★ 1228 评分 2021-09-27
voicefixer_main 开源

一键修复受损语音,让声音恢复清晰

VoiceFixer 是一个通用的语音修复工具,旨在解决语音信号中的各种退化问题,如背景噪声、混响和低质···

★ 290 评分 2021-09-26
video-bgm-generation 开源

根据视频内容自动生成匹配的背景音乐,省时又专业

video-bgm-generation 是 ACM MM 2021 最佳论文的开源实现,旨在为视频自动生成背景音乐。它解决的···

★ 326 评分 2021-09-10
voicefixer 开源

一键修复受损语音,去噪去混响去削波,让声音更清晰

VoiceFixer 是一个基于深度学习的通用语音修复工具,旨在恢复受损的语音信号,使其更清晰、更自然。···

★ 1380 评分 2021-09-06
ChineseTtsTflite 开源

安卓离线中文语音合成,快速测试TFLite模型

ChineseTtsTflite 是一个基于 TensorFlowTTS 的安卓离线中文语音合成引擎,主要面向 TfLite 模型测···

★ 412 评分 2021-08-28
Comprehensive-Transformer-TTS 开源

用Transformer并行合成语音,速度飞快,效果媲美SOTA。

这是一个基于非自回归Transformer的文本转语音(TTS)项目,集成了多种SOTA Transformer架构,并支···

★ 327 评分 2021-08-24
MidiTok 开源

把乐谱变成 AI 的口粮,喂饱它就能源源不断写歌

专为深度学习模型设计的 MIDI 与符号音乐分词器,提供多种 tokenization 策略,可将符号音乐高效转···

★ 898 评分 2021-08-11
Daft-Exprt 开源

跨说话人迁移韵律,让合成语音更有情感

Daft-Exprt 是一个基于 PyTorch 的非自回归语音合成模型,专注于跨说话人的韵律迁移,旨在解决 exp···

★ 55 评分 2021-08-09
MockingBird 开源

5 秒复刻一个声音,你说什么它就能说什么

只需 5 秒即可克隆一个声音,实现任意文本的实时语音合成。项目基于 PyTorch,提供训练与推理全流程···

★ 36906 评分 2021-08-07