Expressive-FastSpeech2
开源
让TTS带情绪和对话感,快速训练多语言表达性语音
Expressive-FastSpeech2 是一个基于 PyTorch 的非自回归表达性语音合成(TTS)开源项目,在 FastSp···
汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。
共收录 738 个开源项目
Expressive-FastSpeech2
开源
让TTS带情绪和对话感,快速训练多语言表达性语音
Expressive-FastSpeech2 是一个基于 PyTorch 的非自回归表达性语音合成(TTS)开源项目,在 FastSp···
edge-TTS-record
开源
一键录制 Edge 朗读语音,秒存 WAV 音频
edge-TTS-record 是一个面向 Windows 平台的轻量级工具,用于录制 Microsoft Edge 浏览器内置的语音···
facet
开源
用代码实时生成图像和音乐,浏览器即兴创作
facet 是一个基于 NodeJS 和浏览器的实时编码与合成工具,专为生成艺术和算法创作设计。它让用户通···
word2wave
开源
输入文字,快速生成短音频样本
Word2Wave 是一个从文本提示生成短音频样本的开源框架,基于 WaveGAN 和 COALA 模型。它解决了文本···
TalkNet2-pytorch
开源
快速训练轻量级语音合成模型,显式控制音高和时长
TalkNet2-pytorch 是 TalkNet 2 的非官方 PyTorch 实现,TalkNet 2 是一种用于语音合成的非自回归模···
Kazakh_TTS
开源
哈萨克语语音合成,271小时多说话人数据直接可用
Kazakh_TTS 是一个哈萨克语文本转语音(TTS)语料库项目,是早期 KazakhTTS 的扩展版本。它解决了哈···
FCH-TTS
开源
六语种快速语音合成,实时交互不卡顿
FCH-TTS 是一个快速文本转语音(TTS)模型,基于 Python 实现,支持英语、中文、日语、韩语、俄语和···
DiffWave-Vocoder
开源
用扩散模型快速生成高质量语音波形,模型小、速度快。
DiffWave-Vocoder 是一个基于 PyTorch 的 DiffWave 声码器非官方复现项目。DiffWave 是一种高质量的···
STYLER
开源
快速且可控地合成富有表现力的语音,风格随心调。
STYLER 是 INTERSPEECH 2021 发表的语音合成论文官方实现,专注于表达性且可控的神经文本转语音(T···
SpeakIt_Vietnamese_TTS
开源
在 Windows 上轻松将越南语文本变成语音,开箱即用。
SpeakIt_Vietnamese_TTS 是一个基于 Windows 平台的越南语文本转语音(TTS)工具,使用 C# 和 WPF ···
LPC_for_TTS
开源
从梅尔频谱图快速提取LPC系数,助力TTS声学建模
LPC_for_TTS 是一个基于 Python 的线性预测系数(LPC)估计工具,专为语音合成(TTS)场景设计。它···
Voice-Cloning-App
开源
上传几秒音频,即刻克隆人声并合成任意文本
Voice-Cloning-App 是一个基于 Python 和 PyTorch 的开源语音克隆工具,旨在让用户通过简单的操作合···
mel-cepstral-distance
开源
算两段语音差多少,客观评估合成质量
这是一个用于计算两段语音或音频之间Mel倒谱距离(MCD)的Python库,MCD是语音合成与语音转换领域常···
AdaSpeech
开源
用少量样本快速定制专属语音合成模型
AdaSpeech 是一个基于 PyTorch 的自适应文本转语音(TTS)项目,旨在为自定义声音提供高质量的语音···
XZVoice
开源
免费开源的桌面TTS工具,一键把文字变成自然语音
XZVoice是一款免费开源的文本转语音(TTS)桌面软件,基于Electron和Vue构建,旨在为用户提供便捷、···
mandarin-tts
开源
用FastSpeech 2快速搭建中文语音合成,轻松生成普通话音频。
mandarin-tts 是一个基于 PyTorch 实现的中文普通话语音合成(TTS)开源项目。它采用 FastSpeech 2···
voice_indonesian
开源
离线印尼语文本转语音,代码示例即拿即用
这是一个印度尼西亚语离线文本转语音(TTS)的示例代码项目,主要用于将文本转换为语音,且完全离线···
resemble-alexa
开源
给 Alexa 装上克隆嗓音,用 GPT-3 驱动对话
resemble-alexa 是一个示例项目,展示如何构建一个使用真实感语音克隆技术的 Alexa 技能。它结合了···
LightSpeech
开源
用神经架构搜索打造轻量快速语音合成模型
LightSpeech 是一个基于神经架构搜索(NAS)的轻量级快速文本转语音(TTS)项目。它旨在解决传统 T···
DEEPFAKE-AUDIO
开源
给一段声音,克隆出任意人的语音
Deepfake Audio 是一个基于 SV2TTS 技术的神经语音克隆工作室,旨在通过深度学习模型实现高度逼真的···
bot-whatsapp
开源
用 Node.js 快速搭建 WhatsApp 多功能机器人,但已停止维护
bot-whatsapp 是一个基于 open-wa/wa-automate-nodejs 库构建的多功能 WhatsApp 机器人,但项目已停···
BVAE-TTS
开源
用贝叶斯变分自编码器生成更自然多样的语音
BVAE-TTS 是一个基于 PyTorch 的文本转语音(TTS)开源项目,是论文的官方实现。它采用贝叶斯变分自···
text-to-speech
开源
在浏览器里输入文字,一键生成语音播放
这是一个基于Web Speech API的轻量级文本转语音工具,使用纯HTML和JavaScript实现,无需任何后端服···
tegridy-tools
开源
用 NLP 技术让 MIDI 音乐自动生成与风格迁移
tegridy-tools 是一个面向符号音乐(MIDI)的 NLP 与人工智能工具包,旨在用自然语言处理技术处理音···