音频音乐

汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。

共收录 738 个开源项目

AudioGPT 开源

一句话搞定音频理解与生成,还能驱动数字人说话

AudioGPT 是一个多模态音频处理框架,旨在统一理解和生成语音、音乐、声音以及说话头(Talking Hea···

★ 10171 评分 2023-03-16
tiktok-tts 开源

一行代码调用 TikTok 语音合成,快速生成 MP3 音频。

tiktok-tts 是一个基于 Node.js 的轻量级文本转语音工具,通过封装 TikTok 的 TTS API,让开发者能···

★ 118 评分 2023-03-13
vits-simple-api 开源

一键部署 VITS 语音合成 API,快速集成 TTS 到你的应用

vits-simple-api 是一个基于 Python 的轻量级 VITS 语音合成 HTTP 接口服务,通过扩展 Moegoe 项目···

★ 1050 评分 2023-03-13
linuxwave 开源

把系统随机数变成音乐,听见 Linux 的脉搏

linuxwave 是一个用 Zig 语言编写的命令行工具,它从 Linux 系统的熵源(如 /dev/urandom)中读取随···

★ 665 评分 2023-03-13
ElevenLabs-DotNet 开源

用 C# 快速接入 ElevenLabs,实现高质量语音合成。

ElevenLabs-DotNet 是一个非官方的 .NET 客户端库,用于调用 ElevenLabs 的 RESTful API,解决 C# ···

★ 97 评分 2023-03-11
elevenlabs-node 开源

在 Node.js 里快速集成 ElevenLabs 高质量 AI 语音合成

elevenlabs-node 是一个用于 Node.js 的 Eleven Labs 文本转语音(TTS)非官方客户端包。它封装了 ···

★ 179 评分 2023-02-26
Persian-tts-coqui 开源

用 Coqui 框架训练波斯语语音合成模型,快速上手

Persian-tts-coqui 是一个面向波斯语/法尔西语的开源文本转语音(TTS)训练项目,基于 Coqui TTS 框···

★ 216 评分 2023-02-23
MimicMania 开源

输入文本,克隆你的声音,秒出语音

MimicMania 是一个基于 Streamlit 构建的开源语音合成与克隆 Web 应用,旨在让用户通过简单的文本输···

★ 60 评分 2023-02-22
rtvc 开源

实时语音转写与克隆,快速接入 ElevenLabs

rtvc 是一个基于 ElevenLabs API 的实时语音转录与克隆工具,使用 TypeScript 编写。它解决了开发者···

★ 56 评分 2023-02-22
com.rest.elevenlabs 开源

Unity 里一键接入 Eleven Labs 语音合成,快速实现角色配音与播报。

这是一个非官方的 Eleven Labs 语音合成 Unity 客户端,以 UPM 包形式分发,方便 Unity 开发者集成···

★ 109 评分 2023-02-20
elevenlabslib 开源

用 Python 轻松调用 ElevenLabs,快速实现高质量文本转语音。

elevenlabslib 是一个用于 ElevenLabs API 的 Python 封装库,旨在简化开发者对 ElevenLabs 文本转···

★ 158 评分 2023-02-17
epub2tts 开源

把电子书一键变成有声书,通勤路上用耳朵读书

epub2tts 是一个将电子书(epub 或纯文本)转换为有声书的开源工具。它利用生成式 AI 文本转语音(···

★ 960 评分 2023-02-17
WhisperSpeech 开源

反转Whisper,用识别模型生成自然语音,快速搭建TTS应用

WhisperSpeech 是一个基于 PyTorch 的开源文本转语音(TTS)系统,其核心思路是“反转 Whisper”—···

★ 4652 评分 2023-02-14
open-musiclm 开源

输入文字描述,自动生成对应风格的音乐片段

open-musiclm 是 MusicLM 的开源实现,MusicLM 是 Google Research 提出的文本生成音乐模型。该项目···

★ 560 评分 2023-01-29
vall-e 开源

3秒参考音频,零样本克隆任意声音,生成自然语音

VALL-E 是一个基于 PyTorch 的零样本文本转语音(TTS)实现,源自微软提出的神经编解码语言模型。它···

★ 2218 评分 2023-01-27
react-speech-highlight-demo 开源

让文字跟着语音走,边听边读不迷路

这是一个演示如何在 React 和原生 JavaScript 中实现文本转语音(TTS)并高亮当前朗读单词和句子的···

★ 188 评分 2023-01-25
PL-BERT 开源

用音素级 BERT 让 TTS 说话更自然,韵律更生动。

PL-BERT 是一个基于音素级 BERT 的文本到语音(TTS)韵律增强模型,通过引入音素级别的语言模型预测···

★ 269 评分 2023-01-24
Los-Angeles-Music-Composer 开源

用窗口注意力生成多乐器音乐,长序列也能高效创作

Los-Angeles-Music-Composer 是一个基于局部窗口注意力的多乐器音乐生成 Transformer 模型,专注于···

★ 242 评分 2023-01-12
vall-e 开源

三秒语音样本,即刻克隆音色,零样本语音合成

VALL-E 是一个基于 PyTorch 的非官方实现,源自微软提出的神经编解码语言模型,用于零样本文本到语···

★ 2971 评分 2023-01-11
piper 开源

断网也能用,老电脑照样流畅读稿,离线配音不求人

快速、本地的神经网络文本转语音系统,无需联网即可在低算力设备上流畅运行,支持多语言与多音色。···

★ 11290 评分 2023-01-10
tuneflow-py 开源

编曲软件里直接跑 AI,灵感落地不用切工具

将 AI 与音乐算法带入下一代 DAW 的 Python 工具包,支持在数字音频工作站中直接构建音乐算法与 AI···

★ 898 评分 2023-01-07
clipboard-narrator 开源

复制网页文字,后台自动朗读成有声书

clipboard-narrator 是一个基于 Godot 引擎开发的桌面工具,能将任意网页内容转换为有声书。它通过···

★ 67 评分 2022-12-24
NeuralTextToAudio 开源

输入文字描述,自动生成对应音频片段

NeuralTextToAudio 是一个基于文本提示生成合成音频的开源项目,旨在通过自然语言描述来控制音频生···

★ 53 评分 2022-12-21
jpreprocess 开源

用 Rust 重写 OpenJTalk,让日语 TTS 文本预处理更快更安全

jpreprocess 是一个用 Rust 重写 OpenJTalk 的日语文本预处理库,专为文本转语音(TTS)应用设计。···

★ 60 评分 2022-12-18