ttts
开源
从零训练你的专属语音合成模型,快速上手 TTS 实验
ttts 是一个用于训练下一代文本转语音(TTS)系统的开源项目,基于 Python 构建。它旨在提供一套完···
汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。
共收录 738 个开源项目
ttts
开源
从零训练你的专属语音合成模型,快速上手 TTS 实验
ttts 是一个用于训练下一代文本转语音(TTS)系统的开源项目,基于 Python 构建。它旨在提供一套完···
Video2Music
开源
看懂视频情绪,自动生成配乐
Video2Music 是一个基于情感多模态 Transformer 模型的视频配乐生成工具,旨在解决视频自动生成适配···
fish-speech
开源
上传几秒音频,克隆任意音色,生成自然逼真的语音。
fish-speech 是一个开源的文本转语音(TTS)模型,基于 VQGAN 和 Llama 架构,实现了目前最先进的语···
cog-musicgen-remixer
开源
上传音乐,AI 自动重混出新版本
cog-musicgen-remixer 是一个基于 MusicGen-Chord 模型的音乐混音工具,旨在利用 AI 技术对现有音乐···
cog-musicgen-chord
开源
输入和弦,生成符合和声走向的 AI 音乐
cog-musicgen-chord 是一个基于 MusicGen 的音频生成项目,主要实现了和弦条件控制功能。它解决了 ···
FunCodec
开源
把音频变成高质量 token,让 TTS 和音乐生成更简单
FunCodec 是一个面向研究的音频量化工具包,旨在为音频生成任务提供高效、灵活的神经编解码方案。它···
vall-e
开源
3秒参考音频,零样本克隆你的声音
VALL-E 是一个非官方的 PyTorch 实现,旨在复现微软提出的神经编解码语言模型 VALL-E。该项目解决的···
HiFTNet
开源
让语音合成又快又清晰,实时生成高质量人声。
HiFTNet 是一个基于神经网络的声码器(vocoder),用于将声学特征(如梅尔频谱)快速合成为高质量语···
VoiceFlow-TTS
开源
用流匹配让TTS更快更稳,少步采样生成自然语音
VoiceFlow-TTS 是 ICASSP 2024 官方开源的高效文本转语音(TTS)模型,基于修正流匹配(Rectified ···
pyht
开源
一行代码接入 PlayHT,快速实现 AI 语音合成与克隆
pyht 是 PlayHT 官方推出的 Python SDK,用于快速接入其 AI 文本转语音(TTS)与声音克隆 API。它解···
Matcha-TTS
开源
用流匹配让语音合成又快又自然,一步生成不卡顿
Matcha-TTS 是一个基于条件流匹配(Conditional Flow Matching)的快速文本转语音(TTS)架构,发表···
RVC-Studio
开源
让 RVC 语音克隆与转换,像用 App 一样简单直观
RVC-Studio 是一个为 RVC(Retrieval-based Voice Conversion,基于检索的语音转换)相关任务打造的···
TTS-RVC-API
开源
一键合成自然语音,并用 RVC 换音色,打造专属 TTS 服务
TTS-RVC-API 是一个将 Coqui TTS 与 RVC(Retrieval-based Voice Conversion)结合的开源项目,旨在···
RealtimeTTS
开源
实时把文字变语音,低延迟流式输出,轻松集成各种 TTS 引擎。
RealtimeTTS 是一个专注于实时文本转语音(TTS)的 Python 库,旨在解决传统 TTS 引擎延迟高、难以···
MB-iSTFT-VITS2
开源
用多频带解码器加速语音合成,训练更快、推理更省资源
MB-iSTFT-VITS2 是一个基于 PyTorch 的语音合成(TTS)开源项目,它将 MB-iSTFT-VITS 的组件应用到···
midi-model
开源
用 Transformer 自动生成 MIDI 音乐,输入风格,输出旋律。
midi-model 是一个基于 Transformer 架构的符号音乐生成工具,专门处理 MIDI 事件序列。它解决的问···
VITS-Pytorch
开源
一键训练端到端语音合成模型,无需复杂对齐
VITS-Pytorch 是一个基于 PyTorch 的端到端语音合成(TTS)项目,实现了 VITS 模型。VITS 通过对抗···
KaraFan
开源
一键分离人声伴奏,AI帮你做卡拉OK
KaraFan 是一个基于人工智能的音乐分离开源项目,旨在从混合音频中提取人声和伴奏,尤其适用于卡拉···
Applio
开源
一键上传音频,轻松实现声音克隆与转换
Applio 是一个专注于易用性和性能的语音转换工具,基于 PyTorch 实现,支持实时语音到语音转换(VC···
pied
开源
图形化点选,轻松管理 Linux 语音包,即刻发声。
Pied 是一个为 Speech Dispatcher 设计的 Piper 语音包管理器,主要面向屏幕阅读器用户和终端用户。···
vits2_pytorch
开源
用 PyTorch 跑通 VITS2 语音合成,训练推理全流程
vits2_pytorch 是 VITS2 文本转语音模型的非官方 PyTorch 实现。VITS2 是 VITS 的改进版本,通过引···
voicebox-pytorch
开源
用 PyTorch 复现 Meta 最新 TTS 模型,快速跑通语音合成实验
voicebox-pytorch 是 MetaAI 提出的 Voicebox 文本转语音(TTS)模型的非官方 PyTorch 实现。Voice···
edge-tts-go
开源
用 Go 一行代码调用 Edge 免费语音合成,无需密钥
edge-tts-go 是一个用 Go 语言编写的开源库,它允许开发者直接调用微软 Edge 浏览器内置的在线文本···
VALL-E-X
开源
听 3 秒原声就能学舌,任何人的音色都能复刻
微软 VALL-E X 零样本 TTS 模型的开源实现,仅需约 3 秒参考音频即可克隆目标说话人音色,并支持跨···