AudioGPT
开源
一句话搞定音频理解与生成,还能驱动数字人说话
AudioGPT 是一个多模态音频处理框架,旨在统一理解和生成语音、音乐、声音以及说话头(Talking Hea···
汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。
共收录 738 个开源项目
AudioGPT
开源
一句话搞定音频理解与生成,还能驱动数字人说话
AudioGPT 是一个多模态音频处理框架,旨在统一理解和生成语音、音乐、声音以及说话头(Talking Hea···
tiktok-tts
开源
一行代码调用 TikTok 语音合成,快速生成 MP3 音频。
tiktok-tts 是一个基于 Node.js 的轻量级文本转语音工具,通过封装 TikTok 的 TTS API,让开发者能···
vits-simple-api
开源
一键部署 VITS 语音合成 API,快速集成 TTS 到你的应用
vits-simple-api 是一个基于 Python 的轻量级 VITS 语音合成 HTTP 接口服务,通过扩展 Moegoe 项目···
linuxwave
开源
把系统随机数变成音乐,听见 Linux 的脉搏
linuxwave 是一个用 Zig 语言编写的命令行工具,它从 Linux 系统的熵源(如 /dev/urandom)中读取随···
用 C# 快速接入 ElevenLabs,实现高质量语音合成。
ElevenLabs-DotNet 是一个非官方的 .NET 客户端库,用于调用 ElevenLabs 的 RESTful API,解决 C# ···
elevenlabs-node
开源
在 Node.js 里快速集成 ElevenLabs 高质量 AI 语音合成
elevenlabs-node 是一个用于 Node.js 的 Eleven Labs 文本转语音(TTS)非官方客户端包。它封装了 ···
Persian-tts-coqui
开源
用 Coqui 框架训练波斯语语音合成模型,快速上手
Persian-tts-coqui 是一个面向波斯语/法尔西语的开源文本转语音(TTS)训练项目,基于 Coqui TTS 框···
MimicMania
开源
输入文本,克隆你的声音,秒出语音
MimicMania 是一个基于 Streamlit 构建的开源语音合成与克隆 Web 应用,旨在让用户通过简单的文本输···
rtvc
开源
实时语音转写与克隆,快速接入 ElevenLabs
rtvc 是一个基于 ElevenLabs API 的实时语音转录与克隆工具,使用 TypeScript 编写。它解决了开发者···
Unity 里一键接入 Eleven Labs 语音合成,快速实现角色配音与播报。
这是一个非官方的 Eleven Labs 语音合成 Unity 客户端,以 UPM 包形式分发,方便 Unity 开发者集成···
elevenlabslib
开源
用 Python 轻松调用 ElevenLabs,快速实现高质量文本转语音。
elevenlabslib 是一个用于 ElevenLabs API 的 Python 封装库,旨在简化开发者对 ElevenLabs 文本转···
epub2tts
开源
把电子书一键变成有声书,通勤路上用耳朵读书
epub2tts 是一个将电子书(epub 或纯文本)转换为有声书的开源工具。它利用生成式 AI 文本转语音(···
WhisperSpeech
开源
反转Whisper,用识别模型生成自然语音,快速搭建TTS应用
WhisperSpeech 是一个基于 PyTorch 的开源文本转语音(TTS)系统,其核心思路是“反转 Whisper”—···
open-musiclm
开源
输入文字描述,自动生成对应风格的音乐片段
open-musiclm 是 MusicLM 的开源实现,MusicLM 是 Google Research 提出的文本生成音乐模型。该项目···
vall-e
开源
3秒参考音频,零样本克隆任意声音,生成自然语音
VALL-E 是一个基于 PyTorch 的零样本文本转语音(TTS)实现,源自微软提出的神经编解码语言模型。它···
react-speech-highlight-demo
开源
让文字跟着语音走,边听边读不迷路
这是一个演示如何在 React 和原生 JavaScript 中实现文本转语音(TTS)并高亮当前朗读单词和句子的···
PL-BERT
开源
用音素级 BERT 让 TTS 说话更自然,韵律更生动。
PL-BERT 是一个基于音素级 BERT 的文本到语音(TTS)韵律增强模型,通过引入音素级别的语言模型预测···
Los-Angeles-Music-Composer
开源
用窗口注意力生成多乐器音乐,长序列也能高效创作
Los-Angeles-Music-Composer 是一个基于局部窗口注意力的多乐器音乐生成 Transformer 模型,专注于···
vall-e
开源
三秒语音样本,即刻克隆音色,零样本语音合成
VALL-E 是一个基于 PyTorch 的非官方实现,源自微软提出的神经编解码语言模型,用于零样本文本到语···
piper
开源
断网也能用,老电脑照样流畅读稿,离线配音不求人
快速、本地的神经网络文本转语音系统,无需联网即可在低算力设备上流畅运行,支持多语言与多音色。···
tuneflow-py
开源
编曲软件里直接跑 AI,灵感落地不用切工具
将 AI 与音乐算法带入下一代 DAW 的 Python 工具包,支持在数字音频工作站中直接构建音乐算法与 AI···
clipboard-narrator
开源
复制网页文字,后台自动朗读成有声书
clipboard-narrator 是一个基于 Godot 引擎开发的桌面工具,能将任意网页内容转换为有声书。它通过···
NeuralTextToAudio
开源
输入文字描述,自动生成对应音频片段
NeuralTextToAudio 是一个基于文本提示生成合成音频的开源项目,旨在通过自然语言描述来控制音频生···
jpreprocess
开源
用 Rust 重写 OpenJTalk,让日语 TTS 文本预处理更快更安全
jpreprocess 是一个用 Rust 重写 OpenJTalk 的日语文本预处理库,专为文本转语音(TTS)应用设计。···