YourTTS

上传几秒音频,即刻克隆声音并合成语音

YourTTS 是一个面向所有人的零样本多说话人文本转语音(TTS)和零样本语音转换(VC)开源项目。它基于 VITS 架构,通过引入说话人编码器,能够在训练时未见过的说话人声音上进行语音合成和转换,无需针对新说话人进行微调。项目解决了传统 TTS 系统需要大量特定说话人数据进行训练、难以适应新声音的问题,使得个性化语音合成变得简单高效。核心能力包括:零样本语音克隆,仅需数秒参考音频即可合成目标说话人的语音;支持多语言(英语、法语、德语等);同时支持 TTS 和 VC 任务。项目提供了预训练模型和推理代码,方便开发者快速集成和实验。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1052
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队Edresson
所属国家
官网地址
定价模式free
价格说明开源项目,本地部署,完全免费
访问状态
是否开源是
开源协议NOASSERTION
主要语言Jupyter Notebook
技术栈/模型speech-synthesis,tts,voice-conversion,zero-shot-multi-speaker-tts,zero-shot-voice-conversion
GitHub 星标★ 1052
30天Star增速
HF 下载量
上线时间2021-10-06 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:高级 约 30 分钟 部署方式:本地安装 3 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Git(用于克隆代码仓库)
  • Python 环境与 Jupyter Notebook(项目以 Notebook 形式发布)
  • 可访问 GitHub 与 arXiv 的网络环境

安装与启动步骤

  1. 1克隆项目仓库

    从 GitHub 拉取 YourTTS 源码,这是后续查阅 Notebook 和推理代码的基础。README 中未提供其他安装命令。

    git clone https://github.com/Edresson/YourTTS.git
  2. 2阅读论文与仓库文档

    README 仅给出论文摘要与勘误说明,未包含依赖安装与推理命令,需进入仓库目录查看内部说明与 Notebook。

  3. 3准备 Jupyter 运行环境

    项目以 Jupyter Notebook 为主要形式,需先具备可运行 Notebook 的 Python 环境;具体依赖列表请以仓库内文件为准。

如何确认成功

README 未提供启动命令,暂无标准验证方式;能成功打开仓库内的 Jupyter Notebook 即说明代码已正确获取。

常见问题

Q:需要多少参考音频才能合成新说话人的声音?

A:论文定位为零样本多说话人 TTS,少量参考音频即可复刻新声音;若效果不佳,可用不到 1 分钟语音对模型微调,在声音相似度上可达到 SOTA。

Q:支持哪些语言?

A:论文提出的是多语言方案,除英语外还覆盖法语、德语等;在仅有单说话人数据的目标语言上也能取得有希望的结果。

Q:为什么论文中的 SCL 损失可能没生效?

A:README 勘误指出,第 3、4 节的 4 组微调实验(EXP.1~4 + SCL)因实现失误,该损失的梯度未能传播到模型。

Q:零样本语音转换(VC)效果如何?

A:论文称在 VCTK 数据集上,零样本 VC 的结果与当时的 SOTA 相当。

注意事项

  • README 节选只包含论文摘要和勘误,没有安装、依赖和推理命令,教程中的步骤均为通用准备动作,实际部署请以仓库内 Notebook 与代码为准。
  • 项目基于 VITS 架构并加入说话人编码器,复现训练对算力要求较高。
  • 论文地址:https://arxiv.org/abs/2112.02418

核心亮点

  • 真正的零样本:无需微调即可克隆新声音,参考音频仅需数秒
  • 多语言支持:覆盖英法德等语言,适用面广
  • TTS/VC双功能:一个模型同时支持语音合成和语音转换

不足之处

  • 模型训练门槛高:需要大量GPU资源和多说话人数据集,普通用户难以复现
  • 文档/社区待观察:项目文档和社区支持相对有限,新手上手可能遇到困难

适用场景

  • 个性化语音助手:为用户定制专属声音
  • 有声内容创作:快速生成多角色配音
  • 语音修复与转换:将语音转换为目标说话人声音

替代项目

Coqui TTS、XTTS、OpenVoice

项目介绍

YourTTS 是音频音乐领域的开源项目,由 Edresson 开发,2021 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,052)位列前 30%,在音频音乐分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。本地部署,完全免费。

它主要面向的使用场景是:个性化语音助手:为用户定制专属声音。同类可对比的替代方案包括 Coqui TTS、XTTS、OpenVoice。

上一篇:WeeaBlind

下一篇:FlashSpeech

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09