音频音乐

汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。

共收录 738 个开源项目

Step-Audio-EditX 开源

用一句话编辑语音情感和风格,还能零样本合成新声音

Step-Audio-EditX 是一个基于 3B 参数大语言模型和强化学习的音频编辑模型,专注于情感、说话风格和···

★ 979 评分 2025-10-29
VieNeu-TTS 开源

在本地 CPU 上实时合成越南语语音,几秒克隆任意音色。

VieNeu-TTS 是一个专注于越南语的端侧实时文本转语音(TTS)引擎,支持即时声音克隆,无需云端依赖···

★ 2682 评分 2025-10-28
FlexiCodec 开源

低帧率下也能保真,让音频编解码更灵活高效

FlexiCodec 是一个面向低帧率场景的动态神经音频编解码器,由 ICLR 2026 论文提出。它解决传统音频···

★ 54 评分 2025-10-05
silero-stress 开源

给俄语文本自动标重音,让TTS发音更准

Silero Stress 是一个面向俄语的预训练自动重音标注与同形异义词消歧工具。它解决了俄语文本中多音···

★ 161 评分 2025-10-01
MOSS-Speech 开源

跳过文字,语音直接对话,更自然更高效

MOSS-Speech 是一个真正的语音到语音(speech-to-speech)大语言模型,无需文本作为中间引导。它直···

★ 139 评分 2025-09-30
liquid-audio 开源

端到端语音互转,实时交互低延迟

Liquid Audio 是 Liquid AI 推出的语音到语音(speech-to-speech)音频模型系列,旨在解决传统语音···

★ 570 评分 2025-09-29
VibeVoiceFusion 开源

一键微调多说话人语音,低显存批量合成

VibeVoiceFusion 是一个基于微软 VibeVoice(自回归+扩散架构)的全栈多说话人语音合成 Web 系统。···

★ 490 评分 2025-09-26
voices 开源

Java 应用内秒级离线语音合成,无需外部服务

voices 是一个面向 Java 生态的快速进程内文本转语音(TTS)库。它基于 ONNX 运行时和 Piper TTS 引···

★ 59 评分 2025-09-25
voxtream 开源

实时流式语音克隆,边听边合成,语速随心控

VoXtream 是一个全流式零样本文本转语音(TTS)模型,主打极低延迟和语速控制。它解决了传统 TTS 需···

★ 251 评分 2025-09-18
ComfyUI-VoxCPM 开源

在 ComfyUI 里拖拽节点,即可生成高表现力语音并克隆任意声音。

ComfyUI-VoxCPM 是一个为 ComfyUI 设计的音频生成节点,专注于高表现力的语音合成和零样本声音克隆···

★ 509 评分 2025-09-17
VoxCPM 开源

给 AI 一句描述,就能捏出从没听过的全新嗓音

VoxCPM2 是一款无分词器的多语言语音生成模型,支持多语种语音合成、创意音色设计与高保真声音克隆···

★ 37993 评分 2025-09-16
vibevoice-studio 开源

录段声音,就能用你的声音说话

VibeVoice Studio 是一个基于 Python 和 FastAPI 构建的语音克隆与文本转语音(TTS)应用。它允许用···

★ 65 评分 2025-08-30
VibeVoice-ComfyUI 开源

在 ComfyUI 里拖拽节点,一键生成高质量多角色语音

VibeVoice-ComfyUI 是一个将微软 VibeVoice 文本转语音模型集成到 ComfyUI 的自定义节点,让用户能···

★ 1566 评分 2025-08-27
ComfyUI-VibeVoice 开源

在 ComfyUI 里拖拽生成带情感的多角色长语音

ComfyUI-VibeVoice 是一个为 ComfyUI 设计的自定义节点,用于集成 VibeVoice 文本转语音(TTS)引擎···

★ 596 评分 2025-08-27
ddo-tts 开源

安装即用,Edge 语音秒变朗读神器

ddo-tts 是一款基于 Kotlin 开发的 Android 文字转语音应用,内置 EdgeTTS 引擎,无需额外部署或配···

★ 80 评分 2025-08-26
Genie-TTS 开源

把 GPT-SoVITS 模型转成 ONNX,部署快、跑得稳,声音克隆更轻松。

Genie-TTS 是一个专注于 GPT-SoVITS 模型的 ONNX 推理引擎与模型转换工具。它解决了 GPT-SoVITS 模···

★ 1782 评分 2025-08-25
OpenWebTTS 开源

本地模型朗读PDF和EPUB,隐私无忧的Speechify替代品

OpenWebTTS 是一个开源的、可自托管的文本转语音(TTS)Web 应用,旨在作为 Speechify 的替代方案。···

★ 73 评分 2025-08-20
ncnn-android-piper 开源

手机本地跑神经语音合成,离线秒出中文英文语音

ncnn-android-piper 是一个基于 ncnn 推理框架的本地神经网络语音合成(TTS)引擎,专为 Android 和···

★ 69 评分 2025-08-19
lue 开源

终端里读书还能听书,支持多种格式,语音自然如有声书。

lue 是一个运行在终端里的电子书阅读器,核心亮点是集成了高品质的文本转语音(TTS)功能,让用户能···

★ 813 评分 2025-08-16
HunyuanVideo-Foley 开源

看视频自动配音,让无声画面瞬间有真实的声音。

HunyuanVideo-Foley 是腾讯混元团队开源的多模态扩散模型,用于从视频内容自动生成高保真度的拟音音···

★ 1060 评分 2025-08-15
nabu 开源

在安卓上玩转本地 TTS 和 LLM,一键生成有声书

nabu 是一个面向边缘计算的多引擎 TTS 与 LLM 游乐场,基于 Kotlin 开发,专为 Android 设备设计。···

★ 60 评分 2025-08-14
epub2mp3 开源

把电子书变成有声书,用 Edge TTS 一键转 MP3

epub2mp3 是一个用 Python 编写的命令行工具,它利用微软 Edge 的 TTS 服务,将 EPUB 电子书转换为···

★ 85 评分 2025-08-13
ai-voice-cloner 开源

本地免费克隆你的声音,一键生成语音

这是一个本地运行的AI语音克隆桌面应用,无需联网即可使用,且不产生任何运行成本。它解决的是用户···

★ 63 评分 2025-08-11
OtosakuTTS-iOS 开源

在 iPhone 上离线生成自然语音,保护隐私不联网。

OtosakuTTS-iOS 是一个基于 Swift 的离线文本转语音(TTS)库,专为 iOS 和 macOS 平台设计。它利用···

★ 63 评分 2025-08-11