音频音乐

汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。

共收录 738 个开源项目

ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

ai-dj 是一个面向现场音乐表演的 AI 音乐生成工具,以 C++ 编写,基于 JUCE 框架,支持作为独立应用···

★ 246 评分 2025-05-16
AllVoiceLab-MCP 开源

让AI一键开口说话,还能给视频配音翻译

AllVoiceLab-MCP 是 AllVoiceLab 官方推出的模型上下文协议(MCP)服务器,旨在让 AI 助手(如 Cla···

★ 61 评分 2025-05-16
MiniMax-AI.github.io 开源

MiniMax 官方 TTS 开源入口,快速上手语音合成

MiniMax-AI.github.io 是 MiniMax 公司的官方 GitHub Pages 页面,主要展示其文本转语音(TTS)相关···

★ 73 评分 2025-05-09
draft-to-take 开源

本地一键将语音草稿打磨成专业音频成品

Draft to Take 是一个本地优先的 AI 音频制作工作室,旨在将粗糙的语音草稿快速转化为专业级音频成···

★ 77 评分 2025-05-04
tts-audiobook-tool 开源

一个工具集成多种TTS模型,轻松制作高品质有声书

这是一个专注于高质量有声书创作的开源工具,集成了大量主流TTS模型(如Qwen3-TTS、OmniVoice、Vib···

★ 213 评分 2025-05-04
audiopipe 开源

一条命令搞定降噪、分人、转写,会议录音秒变带标签文本

audiopipe 是一个面向音频预处理的 Python 流水线工具,核心目标是把「降噪→说话人分离→语音转写···

★ 210 评分 2025-04-28
awesome-TTS-Colab 开源

在Colab上零配置体验各种TTS和语音克隆模型

这是一个精选的TTS(文本转语音)和语音克隆模型资源列表,专门针对Google Colab环境优化。它汇集了···

★ 68 评分 2025-04-25
abogen 开源

把电子书一键变成带字幕的有声书,听读两不误。

abogen 是一个将电子书(EPUB、PDF 和纯文本)自动转换为带同步字幕的有声书的开源工具。它解决了传···

★ 6056 评分 2025-04-24
Bert-VITS2-MNN 开源

把 Bert-VITS2 塞进手机,离线也能自然发声

Bert-VITS2-MNN 是一个面向 Android 移动端的离线语音合成运行时,基于阿里巴巴的 MNN 推理引擎,将···

★ 162 评分 2025-04-23
Dia-TTS-Server 开源

自托管对话式语音合成,一键部署,支持声音克隆和 OpenAI API。

Dia-TTS-Server 是一个自托管的 Dia TTS 模型推理服务器,旨在解决高质量对话式语音合成部署复杂的···

★ 355 评分 2025-04-22
HeadTTS 开源

浏览器里跑TTS,带时间戳和口型,直接做唇形同步

HeadTTS 是一个基于 Kokoro 的免费神经文本转语音(TTS)工具,专为唇形同步(lip-sync)场景设计。···

★ 177 评分 2025-04-21
dia 开源

一句话说出超逼真对话,情绪到位,不用反复重录

一款能够一次性生成超逼真对话的 TTS 模型,无需多次迭代即可输出自然流畅、情感丰富的多角色对话语···

★ 19400 评分 2025-04-19
SLED-TTS 开源

免量化流式TTS,边生成边播放,低延迟语音合成

SLED-TTS 是一个基于语言建模方法的流式文本转语音(TTS)模型,无需向量量化即可生成高质量语音。···

★ 110 评分 2025-04-18
ElevenLabs-Clone 开源

自建语音合成服务,摆脱 ElevenLabs 限制和费用

这是一个自托管的 ElevenLabs 替代品,用于文本转语音、声音转换和 AI 音频生成。它基于 Docker、F···

★ 126 评分 2025-04-09
ComfyUI-MegaTTS 开源

在 ComfyUI 里拖拽节点,一键生成中英文语音并克隆音色。

ComfyUI-MegaTTS 是一个基于字节跳动 MegaTTS3 模型的 ComfyUI 自定义节点,为 ComfyUI 用户提供高···

★ 51 评分 2025-04-05
GenVC 开源

零样本音色转换,用自监督语言模型保留情感和韵律

GenVC 是一个基于自监督生成式语言模型的语音转换(Voice Conversion)开源项目,旨在将一个人的声···

★ 60 评分 2025-03-25
Awesome-Vision-to-Music-Generation 开源

看图像视频,一键生成匹配音乐的研究导航

这是一个围绕“视觉生成音乐”方向的精选资源列表,收录了该领域的前沿方法、公开数据集、评估指标···

★ 126 评分 2025-03-24
kokorodoki 开源

轻量级自然语音合成,实时响应,随处可嵌

kokorodoki 是一个基于 Kokoro TTS 模型的自然语音合成应用,旨在提供快速、实时且灵活的文本转语音···

★ 64 评分 2025-03-23
piper-plus 开源

一键安装的多语言流式 TTS,支持 6 种语言和多种硬件加速

piper-plus 是一个多语言神经语音合成(TTS)引擎,基于 VITS 模型并引入韵律增强,支持日语、英语···

★ 216 评分 2025-03-22
orpheus-tts-local 开源

用 LM Studio 在本地跑 Orpheus 3B,免费生成自然语音

Orpheus TTS Local 是一个让 Orpheus 3B 文本转语音模型在本地运行的轻量级工具。它解决了云端 TTS···

★ 550 评分 2025-03-20
teochew-g2p 开源

把潮州话汉字转成音素,让TTS能读出来

teochew-g2p 是一个面向潮州话(Teochew)的文本到音素(grapheme-to-phoneme)转换工具,同时提供···

★ 71 评分 2025-03-20
easyVoice 开源

超长文本一键转语音,多角色配音轻松搞定

easyVoice 是一款开源的文本转语音工具,基于微软 Edge TTS 引擎构建,使用 TypeScript 开发。它主···

★ 2327 评分 2025-03-15
expo-kokoro-onnx 开源

在 Expo 应用中离线运行 Kokoro TTS,一句话实现本地语音合成。

expo-kokoro-onnx 是一个在 Expo 应用中本地运行 Kokoro TTS 的开源项目。它利用 ONNX Runtime 将 ···

★ 94 评分 2025-03-14
ComfyUI-SparkTTS 开源

在 ComfyUI 里拖拽节点,轻松生成自然语音

ComfyUI-SparkTTS 是一个为 ComfyUI 设计的自定义节点,集成了 SparkTTS 文本转语音系统。它利用大···

★ 125 评分 2025-03-14