YourTTS 是音频音乐领域的开源项目,由 Edresson 开发,2021 年首次发布。
在全站 13,090 个收录项目中,它的 GitHub 星标数(1,052)位列前 30%,在音频音乐分类中处于中上游。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。本地部署,完全免费。
它主要面向的使用场景是:个性化语音助手:为用户定制专属声音。同类可对比的替代方案包括 Coqui TTS、XTTS、OpenVoice。

上传几秒音频,即刻克隆声音并合成语音
YourTTS 是一个面向所有人的零样本多说话人文本转语音(TTS)和零样本语音转换(VC)开源项目。它基于 VITS 架构,通过引入说话人编码器,能够在训练时未见过的说话人声音上进行语音合成和转换,无需针对新说话人进行微调。项目解决了传统 TTS 系统需要大量特定说话人数据进行训练、难以适应新声音的问题,使得个性化语音合成变得简单高效。核心能力包括:零样本语音克隆,仅需数秒参考音频即可合成目标说话人的语音;支持多语言(英语、法语、德语等);同时支持 TTS 和 VC 任务。项目提供了预训练模型和推理代码,方便开发者快速集成和实验。
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
1克隆项目仓库
从 GitHub 拉取 YourTTS 源码,这是后续查阅 Notebook 和推理代码的基础。README 中未提供其他安装命令。
git clone https://github.com/Edresson/YourTTS.git2阅读论文与仓库文档
README 仅给出论文摘要与勘误说明,未包含依赖安装与推理命令,需进入仓库目录查看内部说明与 Notebook。
3准备 Jupyter 运行环境
项目以 Jupyter Notebook 为主要形式,需先具备可运行 Notebook 的 Python 环境;具体依赖列表请以仓库内文件为准。
README 未提供启动命令,暂无标准验证方式;能成功打开仓库内的 Jupyter Notebook 即说明代码已正确获取。
Q:需要多少参考音频才能合成新说话人的声音?
A:论文定位为零样本多说话人 TTS,少量参考音频即可复刻新声音;若效果不佳,可用不到 1 分钟语音对模型微调,在声音相似度上可达到 SOTA。
Q:支持哪些语言?
A:论文提出的是多语言方案,除英语外还覆盖法语、德语等;在仅有单说话人数据的目标语言上也能取得有希望的结果。
Q:为什么论文中的 SCL 损失可能没生效?
A:README 勘误指出,第 3、4 节的 4 组微调实验(EXP.1~4 + SCL)因实现失误,该损失的梯度未能传播到模型。
Q:零样本语音转换(VC)效果如何?
A:论文称在 VCTK 数据集上,零样本 VC 的结果与当时的 SOTA 相当。
Coqui TTS、XTTS、OpenVoice
YourTTS 是音频音乐领域的开源项目,由 Edresson 开发,2021 年首次发布。
在全站 13,090 个收录项目中,它的 GitHub 星标数(1,052)位列前 30%,在音频音乐分类中处于中上游。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。本地部署,完全免费。
它主要面向的使用场景是:个性化语音助手:为用户定制专属声音。同类可对比的替代方案包括 Coqui TTS、XTTS、OpenVoice。
上一篇:WeeaBlind
下一篇:FlashSpeech
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK: An Open-Source Foundational Model for Speech Generation and Editing
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···