mlx-audio
开源
苹果设备本地搞定语音,转文字、换声音一步到位
基于 Apple MLX 框架构建的语音库,集文本转语音、语音转文本与语音转语音于一体,可在 Apple Sili···
汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。
mlx-audio
开源
苹果设备本地搞定语音,转文字、换声音一步到位
基于 Apple MLX 框架构建的语音库,集文本转语音、语音转文本与语音转语音于一体,可在 Apple Sili···
vits
开源
文字进、语音出,又快又自然,配音效率翻倍
VITS 采用条件变分自编码器与对抗训练实现端到端文本转语音。在保持高自然度的同时大幅简化合成流程···
VALL-E-X
开源
听 3 秒原声就能学舌,任何人的音色都能复刻
微软 VALL-E X 零样本 TTS 模型的开源实现,仅需约 3 秒参考音频即可克隆目标说话人音色,并支持跨···
EmotiVoice
开源
打几个字就能让配音带情绪,开心难过随你指挥
网易有道开源的多音色、提示词可控 TTS 引擎,通过文本提示即可控制合成语音的情感与风格。支持多种···
espnet
开源
语音识别、合成、翻译一把抓,一个工具箱全搞定
端到端语音处理工具包,覆盖语音识别、语音合成、语音翻译、说话人识别等多项任务。提供统一训练框···
piper
开源
断网也能用,老电脑照样流畅读稿,离线配音不求人
快速、本地的神经网络文本转语音系统,无需联网即可在低算力设备上流畅运行,支持多语言与多音色。···
dia
开源
一句话说出超逼真对话,情绪到位,不用反复重录
一款能够一次性生成超逼真对话的 TTS 模型,无需多次迭代即可输出自然流畅、情感丰富的多角色对话语···
VoxCPM
开源
给 AI 一句描述,就能捏出从没听过的全新嗓音
VoxCPM2 是一款无分词器的多语言语音生成模型,支持多语种语音合成、创意音色设计与高保真声音克隆···
MockingBird
开源
5 秒复刻一个声音,你说什么它就能说什么
只需 5 秒即可克隆一个声音,实现任意文本的实时语音合成。项目基于 PyTorch,提供训练与推理全流程···
OpenVoice
开源
给一段录音,立刻复刻出同款声音,谁都能当配音员
由 MIT 与 MyShell 联合打造的开源音频基础模型,支持即时声音克隆。仅需一段参考音频即可克隆任意···
ChatTTS
开源
日常对话配音自然到像真人,再也不用听机器腔
专为日常对话场景设计的生成式语音模型,能够生成自然流畅、富有表现力的对话语音。支持细粒度韵律···
TTS
开源
把文字变成真人语音,多语言多音色随你挑
面向文本转语音的深度学习工具包,历经研究与生产环境双重考验。支持多语言、多语音模型,提供丰富···