音频音乐

汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。

共收录 738 个开源项目

CDCD 开源

用图像生成音乐,或反之,跨模态创作一键搞定

CDCD是一个跨模态音乐与图像生成的学术研究项目,发表于ICLR 2023。它提出了一种离散对比扩散模型,···

★ 163 评分 2022-04-25
midi-emotion 开源

输入情感坐标,自动生成多乐器 MIDI 音乐

midi-emotion 是一个基于情感生成多乐器 MIDI 音乐的开源工具。它接收用户在 valence-arousal(效价···

★ 66 评分 2022-04-20
mmt 开源

用 Transformer 一键生成多轨协调的完整音乐

mmt 是论文《Multitrack Music Transformer》(ICASSP 2023)的官方实现,一个基于 Transformer 的···

★ 155 评分 2022-04-16
tiktok-voice 开源

一行代码调用 TikTok TTS,免费生成多种语音

tiktok-voice 是一个简单的 Python 脚本,用于调用 TikTok 的文本转语音(TTS)API,将文字转换为语···

★ 611 评分 2022-04-10
Comprehensive-E2E-TTS 开源

快速搭建非自回归端到端语音合成,对比多种时长建模方案

这是一个基于 PyTorch 的非自回归端到端文本转语音(TTS)项目,直接将文本转换为语音波形,无需中···

★ 147 评分 2022-03-30
Learn2Sing2.0 开源

让AI模仿你的声音唱歌,用扩散模型实现个性化歌声合成

Learn2Sing2.0 是一个基于扩散模型和互信息的目标说话人歌声合成(SVS)开源项目,旨在让用户通过模···

★ 181 评分 2022-03-27
neon-tts-plugin-coqui 开源

给Neon助手装上多语言语音合成,一句话搞定TTS集成。

neon-tts-plugin-coqui 是 Neon AI 开源智能语音助手生态中的文本转语音(TTS)插件,基于 Coqui A···

★ 85 评分 2022-03-23
nix-tts 开源

轻量级端到端TTS,模块蒸馏实现边缘设备实时语音合成

Nix-TTS 是一个轻量级、端到端的文本转语音(TTS)开源项目,通过模块级蒸馏技术大幅压缩模型体积,···

★ 263 评分 2022-03-20
TTS-Voice-Wizard 开源

让 VRChat 虚拟形象实时显示说话文字并语音回复

TTS-Voice-Wizard 是一个面向 VRChat 和 VTuber 的语音转文字再转语音(STTTS)工具。它解决的是虚···

★ 809 评分 2022-03-15
g2pW 开源

中文多音字转拼音,让语音合成更准确

g2pW 是一个中文普通话的字素到音素(G2P)转换工具,主要解决中文文本到拼音或注音转换的问题。它···

★ 412 评分 2022-03-11
neoscore 开源

用代码画出任意乐谱,图形控制随心所欲

neoscore 是一个基于 Python 的音乐记谱库,采用图形优先(graphics-first)的范式,将音乐符号视为···

★ 122 评分 2022-03-11
iSTFTNet-pytorch 开源

用 iSTFT 加速声码器,轻量快速合成高质量语音

iSTFTNet-pytorch 是一个轻量级、快速的声码器(vocoder)实现,基于逆短时傅里叶变换(iSTFT)来加···

★ 281 评分 2022-03-07
to-the-stars 开源

把魔法少女小圆外传小说翻译成中文,还能听语音版

这是一个以《魔法少女小圆》外传小说《飞向星空》为蓝本的中文翻译项目,采用JavaScript实现,主要···

★ 87 评分 2022-02-20
lyrictor 开源

把歌曲变成可分享的 AI 视觉作品,无需设计基础

lyrictor 是一款基于 TypeScript 构建的桌面与浏览器双端创意工具,旨在将个人对歌曲的理解转化为可···

★ 56 评分 2022-02-18
DiffGAN-TTS 开源

用扩散+GAN,几步生成高保真语音,又快又真

DiffGAN-TTS 是一个基于 PyTorch 的文本转语音(TTS)实现,核心思想是结合扩散模型(Diffusion)和···

★ 349 评分 2022-02-14
NATSpeech 开源

并行生成语音,速度翻倍,效果不输自回归

NATSpeech 是一个非自回归语音合成(NAR-TTS)框架,基于 PyTorch 实现,集成了 PortaSpeech(Neur···

★ 1004 评分 2022-02-13
UEAzSpeech 开源

在虚幻引擎中一键接入 Azure 语音,实现语音识别与合成。

UEAzSpeech 是一个将 Azure 语音认知服务集成到虚幻引擎(Unreal Engine)中的插件。它解决了游戏和···

★ 215 评分 2022-02-07
FastDiff 开源

让扩散声码器实时生成高质量语音,告别慢速合成。

FastDiff 是一个基于 PyTorch 实现的快速音频生成模型,源自 IJCAI 2022 论文。它属于神经声码器(···

★ 424 评分 2022-01-17
RapidTTS 开源

本地快速语音合成,多模型一键切换,低延迟高音质。

RapidTTS 是一个轻量级的文本转语音(TTS)框架,专注于本地快速推理和高品质语音合成。它集成了多···

★ 56 评分 2022-01-17
CDFSE_FastSpeech2 开源

零样本语音合成,让AI模仿任何人的声音更逼真

CDFSE_FastSpeech2 是论文《Content-Dependent Fine-Grained Speaker Embedding for Zero-Shot Spe···

★ 86 评分 2022-01-17
ms-ra-forwarder 开源

免费调用微软神经网络语音,快速搭建文本转语音服务

ms-ra-forwarder 是一个基于 TypeScript 开发的免费在线文本转语音(TTS)API 服务。它通过转发微软···

★ 1058 评分 2022-01-08
One-Shot-Voice-Cloning 开源

一句话声音克隆,用Unet-TTS快速复刻音色并生成语音

One-Shot-Voice-Cloning 是一个基于 Unet-TTS 架构的一次性语音克隆开源项目,旨在通过少量参考音频···

★ 243 评分 2021-12-30
VITS 开源

用文本合成语音,还能一键变声,端到端搞定。

VITS 是一个基于 PyTorch 的文本转语音(TTS)与语音转换(VC)工具,支持将文本合成为自然语音,并···

★ 93 评分 2021-12-20
DiffSinger 开源

用扩散模型快速生成高自然度歌声,输入MIDI即可合成演唱。

DiffSinger 是一个基于浅层扩散机制的开源歌声合成(SVS)与语音合成(TTS)项目,源自 AAAI 2022 ···

★ 4862 评分 2021-12-17