音频音乐

汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。

共收录 738 个开源项目

WhisperSubTranslate 开源

本地免费生成字幕并翻译,无需上传,隐私无忧

WhisperSubTranslate 是一款免费、本地优先的桌面应用,基于 Electron 构建,利用 OpenAI Whisper ···

★ 741 评分 2025-08-11
TTS-Audio-Suite 开源

在 ComfyUI 里拖拽节点,本地跑多种 TTS 和声音克隆

TTS-Audio-Suite 是一个 ComfyUI 自定义节点集成包,旨在为本地多引擎、多语言的文本转语音(TTS)···

★ 1215 评分 2025-08-06
Kitten-TTS-Server 开源

自托管轻量 TTS 服务,长文本有声书一键生成

Kitten-TTS-Server 是一个自托管的轻量级文本转语音(TTS)API 服务器,基于 Kitten TTS 模型构建,···

★ 279 评分 2025-08-05
nonverspeech38k 开源

让AI学会笑、叹、哼,生成自然非语言人声

NonVerbalSpeech-38K 是一个用于非语言语音(如笑声、叹息、哼声等)生成与理解的开源项目,源自同···

★ 71 评分 2025-08-02
codename-rvc-fork-4 开源

一键克隆音色,实时转换歌声,创作更自由

Codename's rvc fork version 4 是一个基于 Applio 的歌声转换工具分支,专注于语音与歌声的实时转···

★ 53 评分 2025-08-02
jamify 开源

像搭积木一样生成歌曲,每个音符都能控

jamify 是一个基于流匹配(Flow Matching)的轻量级歌曲生成器,旨在解决现有音乐生成模型在细粒度···

★ 170 评分 2025-07-28
kokoro-coreml 开源

一键转换 Kokoro TTS 到 Apple 芯片,实现端侧快速语音合成

kokoro-coreml 是一个将 Kokoro TTS 模型从 PyTorch 转换为 CoreML 格式的流水线工具,旨在解锁 Ap···

★ 67 评分 2025-07-09
SpeakThat 开源

戴上耳机,重要通知自动念给你听,解放双眼。

SpeakThat 是一款 Android 平台的开源通知朗读工具,旨在将手机上的各类通知通过文字转语音(TTS)···

★ 134 评分 2025-07-06
Dia-Finetuning-Vietnamese 开源

用Dia微调越南语TTS,快速实现语音克隆

这是一个面向越南语的TTS(文本转语音)微调项目,基于Dia框架实现。它解决了越南语语音合成中缺乏···

★ 128 评分 2025-07-05
learnable-speech 开源

无需对齐,快速实现跨语言语音合成与克隆

learnable-speech 是一个基于可学习音频编码器的文本转语音(TTS)项目,无需与文本参考对齐即可实···

★ 56 评分 2025-06-28
FluidAudio 开源

在苹果设备上本地运行前沿音频 AI,实现离线语音交互。

FluidAudio 是一个面向 iOS/macOS 开发者的 Swift 框架,旨在将前沿的 CoreML 音频模型无缝集成到原···

★ 2906 评分 2025-06-21
Twocast 开源

一键把文章变成双人对话播客,多语言多音色,替代 NotebookLM

Twocast 是一个开源的 AI 播客生成器,专注于生成双语音频节目,支持多语言和多音色,被视为 Noteb···

★ 1291 评分 2025-06-20
MOSS-TTSD 开源

从短音频克隆声音,生成多说话人 expressive 对话

MOSS-TTSD 是一个面向表达性多说话人合成的口语对话生成模型。它解决了传统语音合成在长上下文建模···

★ 1400 评分 2025-06-17
kokoro-tts-addon 开源

在浏览器里离线跑神经TTS,低配硬件也能流畅发声。

kokoro-tts-addon 是一个面向浏览器的本地神经文本转语音(TTS)解决方案,旨在让网页应用无需联网···

★ 66 评分 2025-06-12
voicehub 开源

一套接口,调用所有 TTS 模型,快速集成语音合成。

VoiceHub 是一个为文本转语音(TTS)模型提供统一推理接口的开源工具。它解决了 TTS 模型生态碎片化···

★ 119 评分 2025-06-10
edge-tts-universal 开源

无需 Edge 和 API key,任意 JS 环境一键接入微软语音合成

edge-tts-universal 是一个基于 TypeScript 编写的同构 JavaScript 库,让你无需安装 Microsoft Ed···

★ 81 评分 2025-06-08
chatterbox-tts-api 开源

本地跑个 OpenAI 兼容的语音克隆 API,随便接进你的 AI 应用

Chatterbox TTS API 是一个本地部署的、兼容 OpenAI 接口的文本转语音服务,基于 Chatterbox 模型实···

★ 682 评分 2025-05-31
Chatterbox-TTS-Server 开源

一键自托管,轻松生成高质量语音,支持声音克隆和长文本处理。

Chatterbox-TTS-Server 是一个自托管的文本转语音(TTS)服务,基于强大的 Chatterbox 模型。它解决···

★ 1451 评分 2025-05-31
Chatterbox-TTS-Extended 开源

把整本书丢进去,自动生成有声书,还能克隆声音

Chatterbox-TTS-Extended 是 Chatterbox 文本转语音项目的增强版,主要解决原始版本对输入文本长度···

★ 578 评分 2025-05-30
Speech2Speech 开源

本地运行,语音转语音,隐私全掌握

Speech2Speech 是一个完全私密的语音转语音 Web 应用,用户可以通过浏览器直接完成语音输入、识别、···

★ 88 评分 2025-05-30
MagiCodec 开源

单层流式音频编码,让下游模型更易用

MagiCodec 是一个单层流式音频编解码模型,旨在提供当前最优的音频质量,并生成离散 token,以提升···

★ 129 评分 2025-05-29
parkiet 开源

荷兰语文本秒变自然语音,开源 TTS 模型

Parkiet 是一个基于 JAX 的荷兰语文本转语音(TTS)模型,参数量为 16 亿。它旨在解决荷兰语语音合···

★ 94 评分 2025-05-27
AudioMuse-AI 开源

声学分析自动挖掘曲库,生成智能歌单,找回被遗忘的好歌。

AudioMuse-AI 是一个开源的智能音乐分析引擎,专注于解决音乐库中“有歌却难找”的痛点。它通过声学···

★ 2653 评分 2025-05-24
StreamingKokoroJS 开源

浏览器里无限量本地语音合成,告别云端依赖

StreamingKokoroJS 是一个基于 Kokoro-JS 的浏览器端文本转语音(TTS)库,主打 100% 本地运行与完···

★ 372 评分 2025-05-19