音频音乐

汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。

mlx-audio 开源

苹果设备本地搞定语音,转文字、换声音一步到位

基于 Apple MLX 框架构建的语音库,集文本转语音、语音转文本与语音转语音于一体,可在 Apple Sili···

★ 7697 评分 2026-08-09
vits 开源

文字进、语音出,又快又自然,配音效率翻倍

VITS 采用条件变分自编码器与对抗训练实现端到端文本转语音。在保持高自然度的同时大幅简化合成流程···

★ 7889 评分 2026-08-09
VALL-E-X 开源

听 3 秒原声就能学舌,任何人的音色都能复刻

微软 VALL-E X 零样本 TTS 模型的开源实现,仅需约 3 秒参考音频即可克隆目标说话人音色,并支持跨···

★ 7934 评分 2026-08-09
EmotiVoice 开源

打几个字就能让配音带情绪,开心难过随你指挥

网易有道开源的多音色、提示词可控 TTS 引擎,通过文本提示即可控制合成语音的情感与风格。支持多种···

★ 8517 评分 2026-08-09
espnet 开源

语音识别、合成、翻译一把抓,一个工具箱全搞定

端到端语音处理工具包,覆盖语音识别、语音合成、语音翻译、说话人识别等多项任务。提供统一训练框···

★ 9916 评分 2026-08-09
piper 开源

断网也能用,老电脑照样流畅读稿,离线配音不求人

快速、本地的神经网络文本转语音系统,无需联网即可在低算力设备上流畅运行,支持多语言与多音色。···

★ 11276 评分 2026-08-09
dia 开源

一句话说出超逼真对话,情绪到位,不用反复重录

一款能够一次性生成超逼真对话的 TTS 模型,无需多次迭代即可输出自然流畅、情感丰富的多角色对话语···

★ 19367 评分 2026-08-09
VoxCPM 开源

给 AI 一句描述,就能捏出从没听过的全新嗓音

VoxCPM2 是一款无分词器的多语言语音生成模型,支持多语种语音合成、创意音色设计与高保真声音克隆···

★ 35117 评分 2026-08-09
MockingBird 开源

5 秒复刻一个声音,你说什么它就能说什么

只需 5 秒即可克隆一个声音,实现任意文本的实时语音合成。项目基于 PyTorch,提供训练与推理全流程···

★ 36918 评分 2026-08-09
OpenVoice 开源

给一段录音,立刻复刻出同款声音,谁都能当配音员

由 MIT 与 MyShell 联合打造的开源音频基础模型,支持即时声音克隆。仅需一段参考音频即可克隆任意···

★ 37109 评分 2026-08-09
ChatTTS 开源

日常对话配音自然到像真人,再也不用听机器腔

专为日常对话场景设计的生成式语音模型,能够生成自然流畅、富有表现力的对话语音。支持细粒度韵律···

★ 39754 评分 2026-08-09
TTS 开源

把文字变成真人语音,多语言多音色随你挑

面向文本转语音的深度学习工具包,历经研究与生产环境双重考验。支持多语言、多语音模型,提供丰富···

★ 45868 评分 2026-08-09