音频音乐

汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。

共收录 738 个开源项目

TFGAN 开源

融合时频域GAN,生成高保真语音

TFGAN 是一个基于生成对抗网络(GAN)的高保真语音合成开源项目,核心创新在于同时利用时域和频域信···

★ 88 评分 2020-11-30
zhtts 开源

CPU 上实时合成中文语音,无需显卡也能跑

zhtts 是一个基于 Python 的中文实时语音合成系统演示项目,专注于在 CPU 上实现低延迟的文本转语音···

★ 177 评分 2020-11-25
Tacotron 开源

长文本语音合成不掉字,PyTorch 实现 Tacotron

Tacotron 是一个基于 PyTorch 实现的端到端文本转语音(TTS)系统,专注于长句语音合成的鲁棒性。它···

★ 115 评分 2020-11-02
FastSpeech2 开源

用 PyTorch 快速实现多说话人语音合成,训练推理都省心

FastSpeech2 是一个基于 PyTorch 的多说话人端到端文本转语音(TTS)开源实现,源自微软提出的 Fas···

★ 99 评分 2020-11-01
CycleGAN-VC3 开源

无需平行语料,一键转换声音风格

CycleGAN-VC3 是一个基于 CycleGAN 的语音转换(Voice Conversion)开源项目,旨在将一个人的声音转···

★ 158 评分 2020-10-27
LVCNet 开源

用位置可变卷积,让语音合成又快又自然

LVCNet 是一个面向语音合成(TTS)场景的高效声码器(vocoder),由韩国团队在 ICASSP 2021 提出。···

★ 80 评分 2020-10-21
hifi-gan 开源

让语音合成又快又真,实时生成高保真音频

HiFi-GAN 是一个基于生成对抗网络的高保真语音合成声码器,由韩国首尔大学团队开发。它解决了传统神···

★ 2371 评分 2020-10-14
TextToTalk 开源

游戏聊天自动朗读,解放双眼,不错过任何重要信息。

TextToTalk 是一个专为《最终幻想14》游戏打造的 Dalamud 插件,它能够将游戏内的聊天文本实时转换···

★ 76 评分 2020-10-09
DNN-HSMM 开源

用 DNN+HSMM 打造更自然的语音合成声学模型

DNN-HSMM 是一个基于 PyTorch 实现的语音合成(TTS)工具,核心是将深度神经网络(DNN)与隐半马尔···

★ 73 评分 2020-09-27
diffwave 开源

用扩散模型快速生成高保真语音波形,让 TTS 更自然高效。

DiffWave 是一个基于扩散概率模型的神经声码器与波形合成器,由 Google Brain 团队提出,用于从梅尔···

★ 886 评分 2020-09-23
wavegrad 开源

几步生成高保真语音,比 WaveNet 快几十倍

WaveGrad 是一个基于分数匹配的快速高质量神经声码器,由 Google Research 提出,用于从梅尔频谱图···

★ 299 评分 2020-09-16
silero-models 开源

几行代码实现高质量语音合成与识别,CPU也能跑

Silero Models 是一个提供预训练语音模型的集合,专注于让文本转语音(TTS)和语音识别(STT)变得···

★ 6122 评分 2020-09-11
WaveGrad 开源

用扩散模型快速生成高保真语音波形,一步到位

WaveGrad 是 Google Brain 提出的高保真语音合成声码器(vocoder)的 PyTorch 非官方实现。它基于扩···

★ 408 评分 2020-09-03
dectalk 开源

让 90 年代经典 DECtalk 语音在现代电脑上重新发声

dectalk 项目旨在为 90 年代/00 年代的 DECtalk 文本转语音(TTS)应用提供现代化构建。DECtalk 是···

★ 465 评分 2020-08-28
dla 开源

一站式音频深度学习工具箱,快速搞定语音识别与合成

dla 是一个面向音频处理的深度学习开源项目,旨在为音频相关任务提供一套完整的解决方案。它涵盖了···

★ 768 评分 2020-08-23
TensorVox 开源

本地离线跑神经语音合成,低延迟高隐私,桌面即用

TensorVox 是一个用 C++ 编写的桌面端神经语音合成应用,专注于将文本实时转换为自然语音。它解决了···

★ 214 评分 2020-08-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

swift-tts 是一个面向 Swift 开发者的轻量级文本转语音(TTS)封装库,基于 AVFoundation 的 AVSpe···

★ 52 评分 2020-08-08
TTS-recipes 开源

一键跑通多种数据集的 TTS 训练配方,快速上手语音合成。

TTS-recipes 是一个面向不同数据集的文本转语音(TTS)训练配方集合,基于 Coqui AI 生态构建。它解···

★ 89 评分 2020-08-03
VocGAN 开源

让语音合成更自然、更快速,实时生成高保真声音。

VocGAN 是一个基于生成对抗网络(GAN)的高保真实时声码器,专为语音合成和文本转语音(TTS)系统设···

★ 322 评分 2020-08-02
ha-rhvoice 开源

在 Home Assistant 中本地离线生成语音,保护隐私免云端。

ha-rhvoice 是一个 Home Assistant 集成组件,用于接入 RHVoice 本地文本转语音(TTS)引擎。它解决···

★ 54 评分 2020-07-29
Music-SketchNet 开源

画个音乐草图,AI帮你生成完整旋律和节奏

Music-SketchNet 是一个基于 ISMIR 2020 论文的开源项目,旨在通过分解音高和节奏的表征来实现可控···

★ 84 评分 2020-07-24
vietTTS 开源

让应用开口说越南语,开箱即用的高质量 TTS 库

vietTTS 是一个专注于越南语的开源文本转语音(TTS)库,基于深度学习技术构建。它解决了越南语语音···

★ 258 评分 2020-07-21
Crystal 开源

用 C++ 打造统一多语言 TTS 引擎,SSML 接口即插即用

Crystal 是一个基于 C++ 实现的多语言文本转语音(TTS)合成引擎,以 SSML 规范作为统一接口。它旨···

★ 230 评分 2020-06-29
text-to-speech 开源

在 Capacitor 应用里一行代码实现文字转语音

这是一个 Capacitor 社区官方的文本转语音(TTS)插件,用于在 Capacitor 混合应用(支持 Android ···

★ 130 评分 2020-05-28