Matcha-TTS

用流匹配让语音合成又快又自然,一步生成不卡顿

Matcha-TTS 是一个基于条件流匹配(Conditional Flow Matching)的快速文本转语音(TTS)架构,发表于 ICASSP 2024。它旨在解决传统自回归 TTS 合成速度慢、音质不稳定的问题。核心能力包括:采用非自回归的流匹配生成模型,通过概率路径将噪声转换为语音,实现一步或少量步数的高质量合成;支持多说话人训练,提供预训练模型;代码基于 PyTorch,易于扩展和集成。相比扩散模型,流匹配训练更稳定、推理更快,在保持自然度的同时显著降低延迟,适合实时交互场景。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1359
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队shivammehta25
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Jupyter Notebook
技术栈/模型deep-learning,diffusion-model,diffusion-models,flow-matching,machine-learning,non-autoregressive,probabilistic,probabilistic-machine-learning,text-to-speech,tts,tts-api,tts-engines
GitHub 星标★ 1359
30天Star增速
HF 下载量
上线时间2023-09-05 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 3.10(README 建议使用该版本)
  • pip(用于安装 matcha-tts)
  • conda(可选,README 建议用它创建隔离环境)
  • 可访问网络的运行环境(预训练模型会自动下载)

安装与启动步骤

  1. 1创建 conda 环境

    README 建议(非必须)先建一个独立环境,指定 Python 3.10,避免与系统环境冲突。

    conda create -n matcha-tts python=3.10 -y
  2. 2激活环境

    创建完成后激活该环境,后续安装和使用都在此环境中进行。

    conda activate matcha-tts
  3. 3pip 安装 Matcha-TTS

    最简安装方式,直接从 PyPI 安装 matcha-tts 包,适合只想调用推理功能。

    pip install matcha-tts
  4. 4从源码安装

    想改代码或本地开发时用这种方式:先装 GitHub 仓库,再进入目录做可编辑安装。

    pip install git+https://github.com/shivammehta25/Matcha-TTS.git
    cd Matcha-TTS
    pip install -e .
  5. 5运行 CLI/gradio

    README 说明可用命令行 CLI、gradio 应用或 Jupyter notebook 三种方式使用,预训练模型会自动下载;具体启动命令请查看仓库最新 README。

如何确认成功

README 未给出明确验证命令;安装过程无报错即基本完成,随后可通过 CLI、gradio 应用或 Jupyter notebook 使用。

常见问题

Q:必须用 conda 创建环境吗?

A:不是必须的。README 写明这一步是建议而非必需,你也可以在已有 Python 3.10 环境中直接用 pip 安装。

Q:pip 安装和从源码安装该选哪个?

A:只想快速使用就选 pip install matcha-tts;需要修改代码、做二次开发则从 GitHub 源码安装并执行 pip install -e .。

Q:预训练模型需要手动下载吗?

A:不需要。README 说明预训练模型会随 CLI 或 gradio 界面自动下载,前提是运行环境能访问网络。

Q:不想本地安装怎么办?

A:README 提供了 HuggingFace Space 在线体验链接,可以直接在浏览器中试用 Matcha-TTS。

注意事项

  • conda 环境为可选项,README 标注为 suggested but optional。
  • README 节选中第 3 步的运行命令被截断,实际 CLI/gradio 启动命令请以仓库最新 README 为准,不要凭猜测执行。
  • 预训练模型通过 Google Drive 链接自动下载,网络受限时可能失败。
  • 官方提供了 HuggingFace 在线演示,可用于快速评估效果后再决定是否本地部署。

核心亮点

  • 推理速度快,支持一步合成,远超传统自回归模型
  • 基于流匹配,训练稳定且音质接近扩散模型
  • 提供预训练模型,多说话人支持,开箱即用

不足之处

  • 对长文本的韵律控制可能不如自回归模型精细
  • 文档/社区待观察

适用场景

  • 实时语音助手和交互式对话系统
  • 内容创作中的语音生成(如播客、视频配音)
  • 低延迟的嵌入式或边缘设备TTS部署

替代项目

VITS、FastSpeech 2、Coqui TTS

项目介绍

Matcha-TTS 是音频音乐领域的开源项目,由 shivammehta25 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,359)位列前 30%,在音频音乐分类的 738 个项目里位列前 14%。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:实时语音助手和交互式对话系统。同类可对比的替代方案包括 VITS、FastSpeech 2、Coqui TTS。

上一篇:Chatterbox-TTS-Server

下一篇:merlin

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09