vall-e

3秒参考音频,零样本克隆任意声音,生成自然语音

VALL-E 是一个基于 PyTorch 的零样本文本转语音(TTS)实现,源自微软提出的神经编解码语言模型。它利用大规模语言模型的思路,将语音离散化为音频编解码器(如 EnCodec)的 token 序列,通过自回归和 Non-Autoregressive 两个阶段生成语音,仅需 3 秒的参考音频即可克隆说话人的音色、韵律和情感,实现零样本语音合成。项目解决了传统 TTS 需要大量特定说话人数据的问题,让用户无需微调即可生成任意说话人的自然语音。核心能力包括:语音克隆、跨语种语音合成、高自然度生成。该实现提供了完整的训练和推理流程,并附有演示页面,适合研究者和开发者探索前沿 TTS 技术。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2218
维护状态 低维护
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队lifeiteng
所属国家
定价模式free
价格说明开源项目,提供在线演示页面,可免费体验,无付费版本。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型chatgpt,in-context-learning,large-language-models,text-to-speech,tts,vall-e,valle
GitHub 星标★ 2218
30天Star增速
HF 下载量
上线时间2023-01-27 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 6 步

环境要求

  • Python 环境(需安装 pip)
  • PyTorch 1.13.1 与 torchaudio 0.13.1(CUDA 11.6 版本)
  • espeak-ng(Linux 用 apt-get,macOS 用 brew 安装 espeak)
  • 单张 GPU 即可训练(README 说明可在一张 GPU 上训练)

安装与启动步骤

  1. 1安装 PyTorch

    安装 README 指定的 PyTorch 1.13.1 和 torchaudio 0.13.1,使用 CUDA 11.6 的官方源。

    pip install torch==1.13.1 torchaudio==0.13.1 --extra-index-url https://download.pytorch.org/whl/cu116
  2. 2安装 torchmetrics

    安装 README 中指定版本的 torchmetrics 0.11.1。

    pip install torchmetrics==0.11.1
  3. 3安装音频处理库

    安装 librosa 0.8.1,用于 fbank 特征提取。

    pip install librosa==0.8.1
  4. 4安装 espeak-ng

    Linux 系统用 apt-get 安装 espeak-ng;macOS 则改用 brew install espeak。

    apt-get install espeak-ng
  5. 5安装 phonemizer 与 pypi

    安装 README 指定版本的 phonemizer 和 pypinyin,用于音素与拼音处理。

    pip install phonemizer==3.2.1 pypinyin==0.48.0
  6. 6重装 lhotse

    先卸载已有 lhotse,再从官方 GitHub 仓库安装最新版,README 要求更新到新版本。

    pip uninstall lhotse
    pip uninstall lhotse
    pip install git+https://github.com/lhotse-speech/lhotse

如何确认成功

README 未提供启动或验证命令;可通过 python -c "import torch, torchaudio, phonemizer" 检查依赖是否安装成功。

常见问题

Q:为什么 README 说要卸载两次 lhotse?

A:README 原文连续写了两次 pip uninstall lhotse,属于确保彻底卸载旧版再装 GitHub 最新版的写法,照抄执行即可。

Q:macOS 上 espeak-ng 怎么装?

A:README 注明 OSX 使用 brew install espeak,而不是 apt-get install espeak-ng。

Q:没有 GPU 可以跑吗?

A:README 表示可在单张 GPU 上训练 VALL-E,并未提及 CPU 训练方案,建议配备 GPU。

Q:有预训练模型可以下载吗?

A:README 在 Broader impacts 中明确说明不会提供训练好的模型和服务,需自行训练。

注意事项

  • 该项目为非官方 PyTorch 实现,训练好的模型和服务不会提供。
  • VALL-E 可克隆说话人音色,存在伪造身份等滥用风险,请合规使用。
  • README 未给出克隆仓库、训练脚本、推理命令与端口等具体用法,需自行查阅仓库其他文档。

核心亮点

  • 零样本语音克隆,仅需3秒音频即可模仿新音色,无需微调
  • 基于编解码语言模型,生成语音自然度高,韵律和情感表现佳
  • 提供完整训练和推理代码,附带演示页面,便于快速上手

不足之处

  • 依赖大规模算力和数据,训练成本较高,资源门槛不低
  • 推理速度较慢,自回归生成阶段耗时,实时性不足
  • 文档和社区支持相对有限,需自行摸索细节

适用场景

  • 有声书和播客制作,快速生成个性化旁白
  • 游戏和影视配音,克隆特定角色声音
  • 辅助语音交互产品,实现个性化语音助手

替代项目

XTTS (Coqui TTS)、Bark (Suno AI)、Tortoise-TTS

项目介绍

vall-e 是音频音乐领域的开源项目,由 lifeiteng 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,218)位列前 30%,在音频音乐分类的 738 个项目里位列前 10%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。提供在线演示页面,可免费体验,无付费版本。从国内网络环境看,可直接访问。

它主要面向的使用场景是:有声书和播客制作,快速生成个性化旁白。同类可对比的替代方案包括 XTTS (Coqui TTS)、Bark (Suno AI)、Tortoise-TTS。

上一篇:VieNeu-TTS

下一篇:IMS-Toucan

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09