WhisperSpeech

反转Whisper,用识别模型生成自然语音,快速搭建TTS应用

WhisperSpeech 是一个基于 PyTorch 的开源文本转语音(TTS)系统,其核心思路是“反转 Whisper”——利用 OpenAI 的语音识别模型 Whisper 的内部表征来训练语音合成模型,从而生成自然、高质量的语音。它解决了传统 TTS 系统需要大量配对语音文本数据、训练复杂且声音机械感强的问题。WhisperSpeech 采用自监督学习,从 Whisper 的中间层提取语义和声学特征,通过解码器生成 Mel 频谱,再经声码器合成波形。项目支持多语言,提供预训练模型和微调接口,用户可通过简单命令快速合成语音,并支持情感和风格控制。其独特之处在于利用现有强大识别模型的知识,降低了 TTS 训练门槛,同时保持了高自然度和鲁棒性,适合研究者和开发者构建个性化语音应用。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4650
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队WhisperSpeech
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Jupyter Notebook
技术栈/模型pytorch,speech-synthesis,tts
GitHub 星标★ 4650
30天Star增速
HF 下载量
上线时间2023-02-14 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:高级 约 30 分钟 部署方式:库/依赖 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 运行环境(README 节选未给出具体版本要求)
  • PyTorch(项目技术栈为 PyTorch)
  • 建议具备 NVIDIA GPU(README 提到在 RTX 4090 上可达 12 倍实时)
  • 可访问 GitHub 与官网以获取最新安装说明

安装与启动步骤

  1. 1克隆官方仓库

    从 GitHub 拉取 WhisperSpeech 源码,后续安装与示例都在该目录内进行。

    git clone https://github.com/WhisperSpeech/WhisperSpeech.git
  2. 2进入项目目录

    切换到刚克隆下来的仓库根目录,准备查看文档与示例。

    cd WhisperSpeech
  3. 3阅读安装说明

    README 节选未列出安装命令,请打开仓库 README 与官网查看最新安装方式。

  4. 4准备运行环境

    项目基于 PyTorch,需自行准备 Python 与 PyTorch 环境;README 未指定版本与依赖清单。

  5. 5运行官方示例

    按仓库中提供的 Notebook 或示例脚本尝试合成语音,注意当前版本以英语为主。

如何确认成功

按仓库示例运行后能输出合成的语音文件即视为成功;README 节选未给出具体验证命令。

常见问题

Q:现在支持中文吗?

A:README 说明当前发布版本为英语(LibreLight),多语言版本将在后续发布,因此暂未提供中文合成。

Q:可以商用吗?

A:README 说明代码采用 Apache-2.0 / MIT 许可,模型只用合规授权数据训练,目标是做到商用安全。

Q:合成速度怎么样?

A:README 提到加入 torch.compile、KV 缓存与层优化后,在消费级 RTX 4090 上达到 12 倍实时速度。

Q:支持声音克隆吗?

A:README 提到已有声音克隆演示,并训练了 en+pl+fr 的微型 S2A 多语言克隆模型。

Q:在哪里提问或参与贡献?

A:可以加入 LAION Discord 的 #audio-generation 频道交流、提问或参与开发。

注意事项

  • 本 README 节选未包含安装依赖与运行命令,请以仓库最新 README 和官网为准。
  • 当前发布版本为英语(LibreLight),多语言版本尚未发布。
  • 代码采用 Apache-2.0 / MIT 许可,模型仅使用合规授权数据训练。
  • 项目主要开发形式为 Jupyter Notebook,建议先熟悉 Notebook 运行方式。

核心亮点

  • 创新性地反转Whisper,利用其内部表征,训练数据需求低,语音自然度高
  • 基于PyTorch,代码清晰,支持多语言和预训练模型,易于二次开发
  • 提供命令行和Python API,快速合成语音,并支持微调适应特定声音

不足之处

  • 依赖Whisper模型,推理时需加载较大模型,资源占用较高
  • 文档和社区生态相对薄弱,示例和教程不够丰富
  • 声音风格控制能力有限,情感表达不如商业TTS精细

适用场景

  • 研究者探索自监督语音合成方法
  • 开发者快速生成多语言配音或语音助手
  • 在低资源语言上构建TTS系统

替代项目

Coqui TTS、ESPnet-TTS、MeloTTS

项目介绍

WhisperSpeech 是音频音乐领域的开源项目,由 WhisperSpeech 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(4,650)位列前 10%,在音频音乐分类的 738 个项目里位列前 6%。

近 41 天,它的 GitHub 星标从 4,629 增加到 4,650,净增 21。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:研究者探索自监督语音合成方法。同类可对比的替代方案包括 Coqui TTS、ESPnet-TTS、MeloTTS。

上一篇:teochew-g2p

下一篇:Orpheus-TTS

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09