ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
ai-dj 是一个面向现场音乐表演的 AI 音乐生成工具,以 C++ 编写,基于 JUCE 框架,支持作为独立应用···
汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。
共收录 738 个开源项目
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
ai-dj 是一个面向现场音乐表演的 AI 音乐生成工具,以 C++ 编写,基于 JUCE 框架,支持作为独立应用···
AllVoiceLab-MCP
开源
让AI一键开口说话,还能给视频配音翻译
AllVoiceLab-MCP 是 AllVoiceLab 官方推出的模型上下文协议(MCP)服务器,旨在让 AI 助手(如 Cla···
MiniMax-AI.github.io
开源
MiniMax 官方 TTS 开源入口,快速上手语音合成
MiniMax-AI.github.io 是 MiniMax 公司的官方 GitHub Pages 页面,主要展示其文本转语音(TTS)相关···
draft-to-take
开源
本地一键将语音草稿打磨成专业音频成品
Draft to Take 是一个本地优先的 AI 音频制作工作室,旨在将粗糙的语音草稿快速转化为专业级音频成···
tts-audiobook-tool
开源
一个工具集成多种TTS模型,轻松制作高品质有声书
这是一个专注于高质量有声书创作的开源工具,集成了大量主流TTS模型(如Qwen3-TTS、OmniVoice、Vib···
audiopipe
开源
一条命令搞定降噪、分人、转写,会议录音秒变带标签文本
audiopipe 是一个面向音频预处理的 Python 流水线工具,核心目标是把「降噪→说话人分离→语音转写···
awesome-TTS-Colab
开源
在Colab上零配置体验各种TTS和语音克隆模型
这是一个精选的TTS(文本转语音)和语音克隆模型资源列表,专门针对Google Colab环境优化。它汇集了···
abogen
开源
把电子书一键变成带字幕的有声书,听读两不误。
abogen 是一个将电子书(EPUB、PDF 和纯文本)自动转换为带同步字幕的有声书的开源工具。它解决了传···
Bert-VITS2-MNN
开源
把 Bert-VITS2 塞进手机,离线也能自然发声
Bert-VITS2-MNN 是一个面向 Android 移动端的离线语音合成运行时,基于阿里巴巴的 MNN 推理引擎,将···
Dia-TTS-Server
开源
自托管对话式语音合成,一键部署,支持声音克隆和 OpenAI API。
Dia-TTS-Server 是一个自托管的 Dia TTS 模型推理服务器,旨在解决高质量对话式语音合成部署复杂的···
HeadTTS
开源
浏览器里跑TTS,带时间戳和口型,直接做唇形同步
HeadTTS 是一个基于 Kokoro 的免费神经文本转语音(TTS)工具,专为唇形同步(lip-sync)场景设计。···
dia
开源
一句话说出超逼真对话,情绪到位,不用反复重录
一款能够一次性生成超逼真对话的 TTS 模型,无需多次迭代即可输出自然流畅、情感丰富的多角色对话语···
SLED-TTS
开源
免量化流式TTS,边生成边播放,低延迟语音合成
SLED-TTS 是一个基于语言建模方法的流式文本转语音(TTS)模型,无需向量量化即可生成高质量语音。···
ElevenLabs-Clone
开源
自建语音合成服务,摆脱 ElevenLabs 限制和费用
这是一个自托管的 ElevenLabs 替代品,用于文本转语音、声音转换和 AI 音频生成。它基于 Docker、F···
ComfyUI-MegaTTS
开源
在 ComfyUI 里拖拽节点,一键生成中英文语音并克隆音色。
ComfyUI-MegaTTS 是一个基于字节跳动 MegaTTS3 模型的 ComfyUI 自定义节点,为 ComfyUI 用户提供高···
GenVC
开源
零样本音色转换,用自监督语言模型保留情感和韵律
GenVC 是一个基于自监督生成式语言模型的语音转换(Voice Conversion)开源项目,旨在将一个人的声···
Awesome-Vision-to-Music-Generation
开源
看图像视频,一键生成匹配音乐的研究导航
这是一个围绕“视觉生成音乐”方向的精选资源列表,收录了该领域的前沿方法、公开数据集、评估指标···
kokorodoki
开源
轻量级自然语音合成,实时响应,随处可嵌
kokorodoki 是一个基于 Kokoro TTS 模型的自然语音合成应用,旨在提供快速、实时且灵活的文本转语音···
piper-plus
开源
一键安装的多语言流式 TTS,支持 6 种语言和多种硬件加速
piper-plus 是一个多语言神经语音合成(TTS)引擎,基于 VITS 模型并引入韵律增强,支持日语、英语···
orpheus-tts-local
开源
用 LM Studio 在本地跑 Orpheus 3B,免费生成自然语音
Orpheus TTS Local 是一个让 Orpheus 3B 文本转语音模型在本地运行的轻量级工具。它解决了云端 TTS···
teochew-g2p
开源
把潮州话汉字转成音素,让TTS能读出来
teochew-g2p 是一个面向潮州话(Teochew)的文本到音素(grapheme-to-phoneme)转换工具,同时提供···
easyVoice
开源
超长文本一键转语音,多角色配音轻松搞定
easyVoice 是一款开源的文本转语音工具,基于微软 Edge TTS 引擎构建,使用 TypeScript 开发。它主···
expo-kokoro-onnx
开源
在 Expo 应用中离线运行 Kokoro TTS,一句话实现本地语音合成。
expo-kokoro-onnx 是一个在 Expo 应用中本地运行 Kokoro TTS 的开源项目。它利用 ONNX Runtime 将 ···
ComfyUI-SparkTTS
开源
在 ComfyUI 里拖拽节点,轻松生成自然语音
ComfyUI-SparkTTS 是一个为 ComfyUI 设计的自定义节点,集成了 SparkTTS 文本转语音系统。它利用大···