StyleTTS2

音色情绪几乎以假乱真,听不出是机器在读

StyleTTS 2 通过风格扩散与对抗训练,结合大型语音语言模型,实现了接近人类水平的文本转语音。合成语音的自然度与韵律表现力出众,即使无参考语音也能生成高质量语音,代表 TTS 领域的前沿进展。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 6355
维护状态 低维护
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队yl4579
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,需自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型adversarial-training,deep-learning,diffusion-models,gan,latent-diffusion,latent-diffusion-models,pytorch,speaker-adaptation,speech-synthesis,text-to-speech,tts,wavlm
GitHub 星标★ 6355
30天Star增速
HF 下载量
上线时间2023-06-14 00:00:00
最近更新2026-09-20 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数10

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(项目开发语言为 Python)
  • PyTorch(技术栈包含 pytorch)
  • 具备可用显存的 GPU(README 多次提及 OOM 显存不足问题)
  • 准备训练用的单说话人或多说话人语音数据
  • 准备符合 text|anything 格式的 OOD 文本文件

安装与启动步骤

  1. 1克隆项目仓库

    README 未给出安装命令,先从 GitHub 仓库地址把源码拉到本地,后续按仓库内说明操作。

    git clone https://github.com/yl4579/StyleTTS2.git
  2. 2准备 OOD 文本数据

    SLM 对抗训练需要分布外文本,每行按 text|anything 格式书写,路径后面要填进 OOD_data。

  3. 3修改 config.yml

    在 Configs/config.yml 中设置 OOD_data 路径,并按需调整 min_length、max_len、multispeaker 等关键项。

  4. 4按显存调整训练参数

    若出现显存不足,调低 max_len(单位为帧,默认 hop size 300),并把 batch_percentage 设小以避免 OOM。

关键配置

配置项必填说明示例
OOD_data分布外文本路径,供 SLM 对抗训练使用/your/path/ood_texts.txt
min_lengthOOD 文本最小长度,保证合成语音不会过短100
max_len训练音频最大长度(单位帧),显存不足时调低500
multispeaker训练多说话人模型时设为 true,降噪器结构不同true
batch_percentage控制 SLM 对抗训练批大小,遇 OOM 时调小0.5

如何确认成功

README 未给出启动命令;可确认 config.yml 中 OOD_data 指向的文件存在可读、格式正确,且训练未报 OOM 错误。

常见问题

Q:训练时报显存不足(OOM)怎么办?

A:把 config.yml 中的 max_len 调低,或把 batch_percentage 设为更小的数值,可缓解 SLM 对抗训练中的 OOM。

Q:OOD 文本文件要什么格式?

A:每行一条,格式为 text|anything,即文本后用竖线拼接任意内容;同时用 min_length 控制最短长度。

Q:单说话人和多说话人模型配置有何区别?

A:多说话人需把 multispeaker 设为 true,因为降噪器架构在单说话人与多说话人模型之间不同。

Q:max_len 的单位是什么?

A:单位是帧。默认 hop size 为 300,一帧约等于 300/24000 秒(0.0125 秒),据此换算音频时长。

注意事项

  • README 节选未包含安装与推理命令,实际环境依赖请以官方仓库最新说明为准。
  • 训练前务必先准备好 OOD 文本文件和语音数据,否则 SLM 对抗训练无法进行。
  • batch_percentage 调小虽然能避免 OOM,但会影响训练效率,需自行权衡。

核心亮点

  • 基于风格扩散与对抗训练,结合大语音模型,实现接近人类水平的自然语音合成
  • 支持零样本语音克隆与说话人自适应,少量样本即可迁移音色
  • 采用潜在扩散模型与GAN混合架构,在韵律和表现力上显著优于传统TTS

不足之处

  • 推理速度较慢,实时性要求高的场景部署成本高
  • 训练与调参门槛较高,依赖大规模语音数据和计算资源

适用场景

  • 有声书、播客等长文本高质量语音生成
  • 个性化语音助手与虚拟角色配音
  • 低资源语音克隆与多说话人合成

替代项目

VITS、Tortoise-TTS、XTTS

项目介绍

StyleTTS2 是音频音乐领域的开源项目,由 yl4579 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(6,355)位列前 8%,在音频音乐分类的 738 个项目里位列前 5%。

近 44 天,它的 GitHub 星标从 6,328 增加到 6,355,净增 27。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-20。MIT许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:有声书、播客等长文本高质量语音生成。同类可对比的替代方案包括 VITS、Tortoise-TTS、XTTS。

上一篇:MeloTTS

下一篇:YuE

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09