vits

文字进、语音出,又快又自然,配音效率翻倍

VITS 采用条件变分自编码器与对抗训练实现端到端文本转语音。在保持高自然度的同时大幅简化合成流程,无需额外对齐模块即可直接生成高质量语音,是 TTS 领域的经典里程碑工作,影响深远。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 7895
维护状态 低维护
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队jaywalnut310
所属国家
定价模式free
价格说明开源项目,提供在线演示页面,可免费体验,无付费版本。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型deep-learning,pytorch,speech-synthesis,text-to-speech,tts
GitHub 星标★ 7895
30天Star增速
HF 下载量
上线时间2021-05-26 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:高级 约 10 分钟 部署方式:本地安装 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(README 未指定具体版本)
  • PyTorch 深度学习框架(README 未给出安装命令)
  • Git(用于克隆仓库)
  • 具备一定算力的机器,训练 TTS 模型通常建议使用 GPU(README 未明确说明)

安装与启动步骤

  1. 1克隆官方仓库

    从 GitHub 拉取 VITS 源码到本地,这是后续所有操作的基础。README 未给出其他下载方式。

    git clone https://github.com/jaywalnut310/vits.git
  2. 2进入项目目录

    切换到克隆下来的 vits 文件夹,确认目录内容与 README 描述一致。

    cd vits
  3. 3查看仓库内安装说明

    README 节选只有论文介绍,未提供安装步骤;请以仓库内实际文件(依赖清单、脚本、说明文档)为准,不要照搬外部教程。

  4. 4浏览官方 Demo 页面

    访问官网 demo 试听样例音频,确认这是你需要的 TTS 效果,再决定是否继续投入部署与训练。

如何确认成功

README 节选未给出运行或启动命令,无法据此确认启动成功;只能先确认克隆目录存在、能正常读取仓库内说明文件。

常见问题

Q:为什么没有 pip install 之类的安装命令?

A:README 节选只包含论文摘要与简介,没有安装章节。为避免误导,本教程不编造包名和参数,请打开仓库内实际文件查看依赖与运行方式。

Q:需要 GPU 吗?

A:README 未说明硬件要求。VITS 是端到端 TTS 训练模型,通常训练开销较大,建议按仓库说明和论文要求准备算力。

Q:有预训练模型可以直接用吗?

A:README 提到会提供预训练模型(We also provide the pretrained models),但节选被截断,具体下载地址与用法需查看仓库完整说明。

Q:可以用 Docker 部署吗?

A:README 节选中没有出现任何 Docker 相关内容,因此不提供 docker run 命令。是否容器化需自行根据仓库文件决定。

注意事项

  • 本项目是研究性质的论文实现,主要用于训练与合成 TTS,不是开箱即用的桌面软件或在线服务。
  • README 节选未提供任何依赖清单、端口、配置文件路径,凡本教程未列出的命令都不要凭猜测执行。
  • LJSpeech 等训练数据的下载与预处理方式在节选中未出现,需查阅仓库内文档或论文。
  • 官网 Demo 页面只能试听音频,不等于可部署的在线 API。

核心亮点

  • 端到端TTS架构,无需外部对齐工具,训练和推理流程简化
  • 结合VAE和GAN,生成语音自然度和韵律表现优于传统拼接或两阶段模型
  • 支持多说话人训练,单模型可合成不同音色,社区应用广泛

不足之处

  • 训练资源消耗大,对GPU显存和时长要求高,小规模数据集效果不稳定
  • 推理速度相对较慢,实时性不如FastSpeech等非自回归模型
  • 文档/社区待观察

适用场景

  • 低成本高质量语音合成原型开发
  • 多说话人TTS系统定制(如虚拟主播、有声书)
  • 学术研究:端到端生成模型在语音领域的验证与改进

替代项目

Tacotron2、FastSpeech2、ESPnet-TTS

项目介绍

vits 是音频音乐领域的开源项目,由 jaywalnut310 开发,2021 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(7,895)位列前 6%,在音频音乐分类的 738 个项目里位列前 4%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。提供在线演示页面,可免费体验,无付费版本。从国内网络环境看,可直接访问。

它主要面向的使用场景是:低成本高质量语音合成原型开发。同类可对比的替代方案包括 Tacotron2、FastSpeech2、ESPnet-TTS。

上一篇:VALL-E-X

下一篇:mlx-audio

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09