音频音乐

汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。

共收录 738 个开源项目

ttts 开源

从零训练你的专属语音合成模型,快速上手 TTS 实验

ttts 是一个用于训练下一代文本转语音(TTS)系统的开源项目,基于 Python 构建。它旨在提供一套完···

★ 169 评分 2023-10-24
Video2Music 开源

看懂视频情绪,自动生成配乐

Video2Music 是一个基于情感多模态 Transformer 模型的视频配乐生成工具,旨在解决视频自动生成适配···

★ 199 评分 2023-10-13
fish-speech 开源

上传几秒音频,克隆任意音色,生成自然逼真的语音。

fish-speech 是一个开源的文本转语音(TTS)模型,基于 VQGAN 和 Llama 架构,实现了目前最先进的语···

★ 32855 评分 2023-10-10
cog-musicgen-remixer 开源

上传音乐,AI 自动重混出新版本

cog-musicgen-remixer 是一个基于 MusicGen-Chord 模型的音乐混音工具,旨在利用 AI 技术对现有音乐···

★ 105 评分 2023-10-09
cog-musicgen-chord 开源

输入和弦,生成符合和声走向的 AI 音乐

cog-musicgen-chord 是一个基于 MusicGen 的音频生成项目,主要实现了和弦条件控制功能。它解决了 ···

★ 69 评分 2023-10-09
FunCodec 开源

把音频变成高质量 token,让 TTS 和音乐生成更简单

FunCodec 是一个面向研究的音频量化工具包,旨在为音频生成任务提供高效、灵活的神经编解码方案。它···

★ 449 评分 2023-10-07
vall-e 开源

3秒参考音频,零样本克隆你的声音

VALL-E 是一个非官方的 PyTorch 实现,旨在复现微软提出的神经编解码语言模型 VALL-E。该项目解决的···

★ 88 评分 2023-09-22
HiFTNet 开源

让语音合成又快又清晰,实时生成高质量人声。

HiFTNet 是一个基于神经网络的声码器(vocoder),用于将声学特征(如梅尔频谱)快速合成为高质量语···

★ 260 评分 2023-09-19
VoiceFlow-TTS 开源

用流匹配让TTS更快更稳,少步采样生成自然语音

VoiceFlow-TTS 是 ICASSP 2024 官方开源的高效文本转语音(TTS)模型,基于修正流匹配(Rectified ···

★ 374 评分 2023-09-15
pyht 开源

一行代码接入 PlayHT,快速实现 AI 语音合成与克隆

pyht 是 PlayHT 官方推出的 Python SDK,用于快速接入其 AI 文本转语音(TTS)与声音克隆 API。它解···

★ 218 评分 2023-09-09
Matcha-TTS 开源

用流匹配让语音合成又快又自然,一步生成不卡顿

Matcha-TTS 是一个基于条件流匹配(Conditional Flow Matching)的快速文本转语音(TTS)架构,发表···

★ 1360 评分 2023-09-05
RVC-Studio 开源

让 RVC 语音克隆与转换,像用 App 一样简单直观

RVC-Studio 是一个为 RVC(Retrieval-based Voice Conversion,基于检索的语音转换)相关任务打造的···

★ 232 评分 2023-09-02
TTS-RVC-API 开源

一键合成自然语音,并用 RVC 换音色,打造专属 TTS 服务

TTS-RVC-API 是一个将 Coqui TTS 与 RVC(Retrieval-based Voice Conversion)结合的开源项目,旨在···

★ 114 评分 2023-09-01
RealtimeTTS 开源

实时把文字变语音,低延迟流式输出,轻松集成各种 TTS 引擎。

RealtimeTTS 是一个专注于实时文本转语音(TTS)的 Python 库,旨在解决传统 TTS 引擎延迟高、难以···

★ 4035 评分 2023-08-26
MB-iSTFT-VITS2 开源

用多频带解码器加速语音合成,训练更快、推理更省资源

MB-iSTFT-VITS2 是一个基于 PyTorch 的语音合成(TTS)开源项目,它将 MB-iSTFT-VITS 的组件应用到···

★ 135 评分 2023-08-26
midi-model 开源

用 Transformer 自动生成 MIDI 音乐,输入风格,输出旋律。

midi-model 是一个基于 Transformer 架构的符号音乐生成工具,专门处理 MIDI 事件序列。它解决的问···

★ 378 评分 2023-08-25
VITS-Pytorch 开源

一键训练端到端语音合成模型,无需复杂对齐

VITS-Pytorch 是一个基于 PyTorch 的端到端语音合成(TTS)项目,实现了 VITS 模型。VITS 通过对抗···

★ 59 评分 2023-08-23
KaraFan 开源

一键分离人声伴奏,AI帮你做卡拉OK

KaraFan 是一个基于人工智能的音乐分离开源项目,旨在从混合音频中提取人声和伴奏,尤其适用于卡拉···

★ 150 评分 2023-08-10
Applio 开源

一键上传音频,轻松实现声音克隆与转换

Applio 是一个专注于易用性和性能的语音转换工具,基于 PyTorch 实现,支持实时语音到语音转换(VC···

★ 3756 评分 2023-08-07
pied 开源

图形化点选,轻松管理 Linux 语音包,即刻发声。

Pied 是一个为 Speech Dispatcher 设计的 Piper 语音包管理器,主要面向屏幕阅读器用户和终端用户。···

★ 295 评分 2023-08-07
vits2_pytorch 开源

用 PyTorch 跑通 VITS2 语音合成,训练推理全流程

vits2_pytorch 是 VITS2 文本转语音模型的非官方 PyTorch 实现。VITS2 是 VITS 的改进版本,通过引···

★ 548 评分 2023-08-03
voicebox-pytorch 开源

用 PyTorch 复现 Meta 最新 TTS 模型,快速跑通语音合成实验

voicebox-pytorch 是 MetaAI 提出的 Voicebox 文本转语音(TTS)模型的非官方 PyTorch 实现。Voice···

★ 704 评分 2023-08-01
edge-tts-go 开源

用 Go 一行代码调用 Edge 免费语音合成,无需密钥

edge-tts-go 是一个用 Go 语言编写的开源库,它允许开发者直接调用微软 Edge 浏览器内置的在线文本···

★ 52 评分 2023-07-31
VALL-E-X 开源

听 3 秒原声就能学舌,任何人的音色都能复刻

微软 VALL-E X 零样本 TTS 模型的开源实现,仅需约 3 秒参考音频即可克隆目标说话人音色,并支持跨···

★ 7925 评分 2023-07-29