音频音乐

汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。

共收录 738 个开源项目

NekoSpeak 开源

手机本地离线朗读,隐私无忧,多种模型任选

NekoSpeak 是一款面向 Android 的本地离线 AI 语音合成应用,支持 Kokoro、KittenTTS、Pocket-tts ···

★ 169 评分 2026-01-09
GSV-TTS-Lite 开源

让 GPT-SoVITS 语音克隆跑得更快,部署更简单

GSV-TTS-Lite 是一个专为 GPT-SoVITS 文本转语音模型设计的高性能推理引擎,专注于少样本语音克隆。···

★ 158 评分 2026-01-08
LEMAS-TTS 开源

一个模型克隆10种语言的说话人声音,几秒音频即可合成新语音。

LEMAS-TTS 是一个多语言零样本文本转语音系统,支持中文、英语、西班牙语、俄语、法语、德语、意大···

★ 103 评分 2026-01-05
youtube-auto-dub 开源

一键将 YouTube 视频自动翻译并配音成多语言,保留原声背景音乐。

youtube-auto-dub 是一个基于 AI 的 YouTube 视频自动配音流水线工具。它解决了视频内容跨语言传播···

★ 304 评分 2026-01-05
opencode-smart-voice-notify 开源

编码时用语音播报任务结果,不错过任何关键状态。

这是一个为 OpenCode 打造的智能语音通知插件,主要解决开发者在编码时无法及时关注任务完成状态或···

★ 75 评分 2025-12-27
AceForge 开源

在 Mac 上离线完成 AI 作曲、人声分离和语音合成

AceForge 是一款面向 Apple/OSX 平台的本地优先 AI 音乐工作站,基于 Ace-Step、DeMucs 和 XTTSv2 ···

★ 92 评分 2025-12-19
cosyvoice-docker 开源

一条命令部署阿里 CosyVoice,带界面和 API,秒级克隆音色

CosyVoice 是阿里通义实验室开源的语音合成(TTS)大模型,支持中文、英文、日文等多种语言,具备零···

★ 88 评分 2025-12-18
GPA 开源

一个模型搞定语音识别、合成和转换,轻量高效

GPA(General Purpose Audio)是一个基于Transformer的通用音频模型,由AutoArk团队开发,旨在用单···

★ 3108 评分 2025-12-16
T5Gemma-TTS 开源

上传一段语音,即刻克隆音色并生成多语言自然语音。

T5Gemma-TTS 是一个基于 T5Gemma 编码器-解码器大语言模型的多语言语音合成项目,专注于语音克隆和···

★ 312 评分 2025-12-13
vibevoice-rs 开源

用Rust实现语音克隆与多说话人TTS,高性能低延迟。

vibevoice-rs 是一个基于 Rust 的文本转语音(TTS)引擎,实现了 VibeVoice 的语音克隆与多说话人合···

★ 67 评分 2025-12-11
GLM-TTS 开源

几秒克隆音色,还能带情绪说话,让TTS更自然

GLM-TTS 是一个基于多奖励强化学习的零样本语音合成(TTS)项目,由智谱AI推出。它解决的核心问题是···

★ 1067 评分 2025-12-06
M3-TTS 开源

零样本合成高保真语音,多模态对齐+流匹配

M3-TTS 是一个基于 PyTorch 的开源语音合成项目,实现了论文《M3-TTS: Multi-modal DiT Alignment ···

★ 124 评分 2025-12-04
mlx-audio-swift 开源

在苹果芯片上,用 Swift 轻松实现本地语音/音频 AI 处理。

mlx-audio-swift 是一个专为 Apple Silicon 设计的模块化 Swift 音频处理 SDK,基于 MLX 框架构建。···

★ 784 评分 2025-12-03
soprano 开源

输入文本,秒出超逼真语音,让应用开口说话。

Soprano 是一个基于 Python 的文本转语音(TTS)开源项目,主打即时生成超逼真语音。它解决了传统 ···

★ 1601 评分 2025-11-30
NeuroRVQ 开源

把脑电心电变成token,让生成模型读懂生物信号

NeuroRVQ是一个面向生物信号(如脑电、心电、肌电等)的多尺度神经残差向量量化(Residual Vector ···

★ 52 评分 2025-11-29
supertonic-py 开源

本地极速语音合成,离线也能开口说话

supertonic-py 是一个基于 ONNX Runtime 的轻量级端侧文本转语音(TTS)引擎,旨在提供极速、离线的···

★ 86 评分 2025-11-24
supertonic 开源

手机上秒级生成多语言语音,离线也能用

supertonic 是一个极速的端侧多语言文本转语音(TTS)引擎,基于 ONNX Runtime 原生运行,支持 iOS···

★ 13791 评分 2025-11-18
supertonic 开源

离线秒级生成多语言语音,隐私安全不卡顿

supertonic 是一个超快速、完全离线的多语言文本转语音(TTS)引擎,基于 ONNX Runtime 原生运行,···

★ 13791 评分 2025-11-18
dia2 开源

让 AI 对话实时开口,边生成边播放不卡顿

dia2 是一个开源的实时流式对话语音合成(TTS)模型,基于开放权重架构,支持低延迟的音频流输出。···

★ 1179 评分 2025-11-17
TTS-Story 开源

用标签脚本一键生成多角色有声书,本地或云端引擎任选。

TTS-Story 是一个基于 Web 的多语音 TTS 工作室,专为将带标签的脚本转换为有声书而设计。它解决了···

★ 337 评分 2025-11-14
FlashLabs-Chroma 开源

实时语音对话+声音克隆,几秒复刻你的音色

FlashLabs-Chroma 是全球首个开源的实时端到端语音对话模型,支持个性化声音克隆。它解决了传统语音···

★ 550 评分 2025-11-13
Kani-TTS-Vie 开源

越南语语音合成,3秒推理,轻量模型即用

Kani-TTS-Vie 是一个针对越南语的快速文本转语音(TTS)开源项目,模型参数量仅 370M,推理时间约 ···

★ 67 评分 2025-11-10
ComfyUI-Step_Audio_EditX_TTS 开源

在 ComfyUI 里拖拽节点,几秒克隆声音并编辑音频

ComfyUI-Step_Audio_EditX_TTS 是一个为 ComfyUI 开发的音频处理节点插件,集成了 Step Audio Edit···

★ 63 评分 2025-11-08
ComfyUI-Maya1_TTS 开源

在 ComfyUI 里拖拽节点,生成带情感的语音

ComfyUI-Maya1_TTS 是一个 ComfyUI 自定义节点,用于集成 Maya1 语音合成模型。Maya1 是一个 3B 参···

★ 65 评分 2025-11-05