音频音乐

汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。

共收录 738 个开源项目

IMS-Toucan 开源

一键生成7000种语言的自然语音,还能控制情感和语速

IMS-Toucan 是一个基于 PyTorch 的可控且快速的文本转语音(TTS)工具包,声称支持超过 7000 种语言···

★ 2210 评分 2021-08-05
EbookReader 开源

一个App搞定十余种电子书格式,还能听书

EbookReader 是一款开源的 Android 电子书阅读器应用,旨在解决多格式阅读和听书需求。它支持 epub···

★ 156 评分 2021-08-03
univnet 开源

用GAN声码器,实时合成高质量语音波形

UnivNet是一个基于GAN的神经网络声码器,用于从声学特征(如梅尔频谱)合成高质量语音波形。它由韩···

★ 287 评分 2021-08-02
UnityTTS 开源

在 Unity 里一键让文字开口说话,快速集成 TTS 功能。

UnityTTS 是一个专为 Unity 引擎设计的文本转语音(TTS)解决方案,旨在帮助开发者轻松地在 Unity ···

★ 144 评分 2021-07-31
ubisoft-laforge-daft-exprt 开源

把一个人的说话情绪,无缝搬到另一个人声音里

Daft-Exprt 是育碧旗下 La Forge 团队开源的一个跨说话人韵律迁移工具,用于 expressive speech sy···

★ 127 评分 2021-07-28
MuseMorphose 开源

上传 MIDI,一键转换音乐风格,保留旋律。

MuseMorphose 是一个基于 PyTorch 实现的音乐风格迁移模型,论文发表于 IEEE/ACM TASLP。它利用 Tr···

★ 195 评分 2021-07-19
VAENAR-TTS 开源

用VAE+非自回归框架,让语音合成更快更稳

VAENAR-TTS 是一个基于 PyTorch 的非自回归文本转语音(TTS)合成实现,核心思路是结合变分自编码器···

★ 74 评分 2021-07-15
StyleSpeech 开源

一条参考音频,快速克隆说话风格,合成自然语音

StyleSpeech 是 Meta-StyleSpeech 和 StyleSpeech 论文的官方实现,专注于语音合成(TTS)中的风格···

★ 254 评分 2021-07-11
wavegrad2 开源

用扩散模型直接生成高保真语音波形,一步到位

WaveGrad2 是一个非官方的 PyTorch 实现,基于 Google 提出的 WaveGrad 2 模型,用于高质量语音合成···

★ 111 评分 2021-07-09
apple_airplayer 开源

把 AirPlay 音箱变成会说话的 TTS 喇叭

apple_airplayer 是一个将 AirPlay 设备(如 HomePod、Apple TV)转换为文本转语音(TTS)扬声器的···

★ 138 评分 2021-07-09
FastPitchFormant 开源

分解音高与音色,让语音合成控制更精细

FastPitchFormant 是 NCSOFT 提出的 FastPitchFormant 模型的 PyTorch 非官方实现,该模型基于源-滤···

★ 74 评分 2021-06-30
ttslearn 开源

跟着示例学 TTS,从信号处理到神经语音合成

ttslearn 是一个面向 Python 学习者的语音合成(Text-to-Speech)教学库,由日本学者开发,配套书籍···

★ 269 评分 2021-06-21
WaveGrad2 开源

用分数匹配迭代精炼,快速生成高保真语音波形

WaveGrad2 是谷歌大脑团队提出的 WaveGrad 2 模型的非官方 PyTorch 实现,专注于文本到语音(TTS)···

★ 68 评分 2021-06-18
Fre-GAN-pytorch 开源

用 GAN 生成频率更真实的语音,提升 TTS 听感

Fre-GAN-pytorch 是 Fre-GAN 论文的 PyTorch 非官方实现,Fre-GAN 是一种基于对抗生成网络的音频合···

★ 113 评分 2021-06-16
UnivNet-pytorch 开源

用PyTorch复现UnivNet声码器,快速生成高保真语音波形。

UnivNet-pytorch 是 UnivNet 神经声码器的非官方 PyTorch 实现。UnivNet 是一种用于高保真波形生成···

★ 76 评分 2021-06-16
text-to-speech-api 开源

几行代码接入 Play.ht 语音合成,快速实现文本朗读

这是一个基于 Play.ht 服务的文本转语音 API 封装项目,旨在为开发者提供简单、高效的语音合成接口···

★ 93 评分 2021-06-15
StyleSpeech 开源

一条参考语音,即刻克隆任意音色,快速合成个性化语音。

StyleSpeech 是 Meta-StyleSpeech 的 PyTorch 非官方实现,旨在解决多说话人自适应文本转语音(TTS···

★ 198 评分 2021-06-09
MsEdgeTTS 开源

免密钥免费调用 Edge 高质量语音合成,几行代码集成 TTS

MsEdgeTTS 是一个基于 TypeScript 的轻量级文本转语音(TTS)模块,它巧妙地复用了 Microsoft Edge···

★ 339 评分 2021-06-06
DiffSinger 开源

用扩散模型精修歌声合成,让非自回归 TTS 音质更自然

DiffSinger 是一个基于 PyTorch 的开源歌声合成(Singing Voice Synthesis)项目,核心思想是将浅层···

★ 247 评分 2021-06-03
vits 开源

文字进、语音出,又快又自然,配音效率翻倍

VITS 采用条件变分自编码器与对抗训练实现端到端文本转语音。在保持高自然度的同时大幅简化合成流程···

★ 7893 评分 2021-05-26
mlp-singer 开源

用纯MLP快速合成韩语歌声,告别慢速自回归。

MLP Singer 是一个基于多层感知机(MLP)的韩语歌声合成(Singing Voice Synthesis)开源项目,对应···

★ 118 评分 2021-05-23
Catch-A-Waveform 开源

给一段短音频,生成同风格无限续写

Catch-A-Waveform 是 NeurIPS 2021 论文的官方 PyTorch 实现,旨在解决从单个极短音频样本(如几秒···

★ 190 评分 2021-05-23
edge-tts 开源

免密钥调用微软 Edge 语音,几行代码生成自然 MP3

edge-tts 是一个 Python 库,让你无需安装 Microsoft Edge、Windows 或申请 API key,就能直接调用···

★ 12078 评分 2021-05-10
Parallel-Tacotron2 开源

让语音合成告别逐字生成,并行提速数十倍

Parallel-Tacotron2 是 Google Parallel Tacotron 2 的 PyTorch 非官方实现,旨在解决传统自回归 T···

★ 191 评分 2021-04-30