音频音乐

汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。

共收录 738 个开源项目

Barkify 开源

自己训练 Bark 语音模型,摆脱官方限制

Barkify 是 Suno AI 推出的 Bark 文本转语音模型的非官方训练实现。Bark 是一个基于 Transformer 的···

★ 131 评分 2023-05-15
bark-voice-cloning-HuBERT-quantizer 开源

用几秒语音克隆音色,训练推理全搞定

这是一个用于声音克隆的开源项目,基于Bark模型和HuBERT量化器实现。它解决的核心问题是:如何用少···

★ 710 评分 2023-05-11
CoMoSpeech 开源

一步合成语音和歌声,告别扩散模型慢速采样

CoMoSpeech 是南洋理工大学等机构在 ACM MM 2023 上提出的语音与歌声合成模型,基于一致性模型(Co···

★ 214 评分 2023-05-09
sonata 开源

用 Rust 跑神经 TTS,跨平台、轻量、可嵌入

sonata 是一个用 Rust 编写的跨平台神经 TTS(文本转语音)推理引擎,专注于高效运行神经网络语音合···

★ 75 评分 2023-05-09
audio-webui 开源

一个网页搞定多种音频AI,不用写代码就能玩转音乐生成和语音合成

audio-webui 是一个面向音频相关神经网络的统一 Web 界面,旨在解决音频 AI 工具分散、使用门槛高的···

★ 1243 评分 2023-05-05
TTS-MultiLingual 开源

一行代码为你的应用加上20种语言的语音输出

TTS-MultiLingual 是一个基于 Python 的多语言文本转语音(TTS)工具,支持超过 20 种语言的语音合···

★ 52 评分 2023-05-01
sonata-nvda 开源

给 NVDA 装上神经语音,让屏幕阅读更自然

sonata-nvda 是一个为 NVDA 屏幕阅读器开发的语音合成器驱动插件,利用神经 TTS 模型(如 Piper)提···

★ 73 评分 2023-04-29
WeeaBlind 开源

一键给外语视频配音,克隆原声,多语言本地化

WeeaBlind 是一个用现代 AI 技术为外语影视媒体制作配音的开源工具。它解决了非英语视频内容在本地···

★ 323 评分 2023-04-28
TTS-WebUI 开源

一个界面玩转二十多种语音与音乐生成模型

TTS-WebUI 是一个集成了多种主流语音与音频生成模型的一站式 Web 界面,基于 Gradio 和 React 构建···

★ 3274 评分 2023-04-27
vampnet 开源

用掩码变换器,让AI按你的提示生成音乐片段

vampnet 是一个基于掩码变换器(masked transformer)的音频音乐生成开源项目。它解决的是音乐生成···

★ 357 评分 2023-04-21
SummerTTS 开源

一键编译,离线运行,零依赖的中英文语音合成。

SummerTTS 是一个基于 C++ 的轻量级中英文语音合成(TTS)项目,主打独立编译和零依赖。它解决了传···

★ 544 评分 2023-04-20
elevenlabs 开源

用 Go 轻松调用 ElevenLabs,实现语音合成与识别

这是一个非官方的 Go 语言客户端库,用于调用 ElevenLabs 的 API。它封装了文本转语音、语音转文本···

★ 68 评分 2023-04-17
tango 开源

输入一句话,自动生成匹配的音频内容

tango 是一个用于文本生成音频的扩散模型家族,旨在解决从文字描述直接合成高质量音频的问题。它基···

★ 1240 评分 2023-04-10
rvc-webui 开源

一键部署网页版声音转换工具,轻松实现音色克隆与替换

rvc-webui 是 liujing04 对 Retrieval-based-Voice-Conversion-WebUI(RVC)的重构项目,旨在提供更···

★ 522 评分 2023-04-09
VitsServer 开源

把 VITS 模型秒变高速 TTS 服务,一键部署低延迟合成

VitsServer 是一个基于 VITS 模型和 ONNX Runtime 的文本转语音(TTS)推理服务器,专为快速部署和···

★ 130 评分 2023-04-07
edge-tts-webui 开源

打开网页,输入文字,一键生成自然语音

edge-tts-webui 是一个基于微软 Edge 浏览器在线语音合成服务(edge-tts)的图形化界面工具。它解决···

★ 114 评分 2023-03-31
java-tts 开源

用 Java 轻松调用 Edge TTS,几行代码实现文本转语音

java-tts 是一个基于 Java 实现的文本转语音库,它封装了微软 Edge 的在线 TTS 服务,让 Java 开发···

★ 62 评分 2023-03-30
SNAC 开源

零样本克隆声音,几秒音频即可合成新语音

SNAC 是一个基于 PyTorch 的非官方实现,专注于零样本多说话人文本转语音(TTS)。它通过引入说话人···

★ 57 评分 2023-03-30
elevenlabs-python 开源

一行代码调用 ElevenLabs,生成逼真 AI 语音

ElevenLabs 官方 Python SDK,用于调用 ElevenLabs API,提供文本转语音、语音克隆、声音库管理、语···

★ 3113 评分 2023-03-26
elevenlabs_tts 开源

给 Home Assistant 接入 ElevenLabs 逼真 AI 语音

这是一个将 ElevenLabs 文本转语音(TTS)服务集成到 Home Assistant 的自定义组件。它解决了 Home···

★ 98 评分 2023-03-25
vst 开源

在DAW里输入文字,直接生成声音,创意音色一键即得

vst 是一个开源的音频插件项目,它允许用户直接在数字音频工作站(DAW)中通过输入文字来生成声音。···

★ 141 评分 2023-03-24
subvert 开源

上传视频,秒出字幕、摘要和章节,剪辑效率翻倍。

subvert 是一个基于 PHP 的视频处理工具,利用 OpenAI 的 Whisper 模型自动为视频生成字幕、摘要和···

★ 869 评分 2023-03-22
epub_to_audiobook 开源

把电子书一键变成有声书,直接导入 Audiobookshelf 听

epub_to_audiobook 是一个将 EPUB 电子书转换为有声书的开源工具,专为 Audiobookshelf 优化,并内···

★ 2069 评分 2023-03-21
bob-plugin-akl-microsoft-free-tts 开源

免密钥调用微软语音,Bob 一键朗读翻译结果

这是一个基于微软免费语音合成服务的 Bob 插件,完全无需 API 密钥即可使用。它解决了 Bob 用户需要···

★ 79 评分 2023-03-17