TTS

把文字变成真人语音,多语言多音色随你挑

面向文本转语音的深度学习工具包,历经研究与生产环境双重考验。支持多语言、多语音模型,提供丰富的预训练模型与训练接口,既能快速搭建 TTS 服务,也能满足深入探索语音合成算法的研究需求。

开源 unknown 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 46045
维护状态 低维护
是否开源 是
定价模式 unknown

项目数据

分类音频音乐
开发团队coqui-ai
所属国家
官网地址http://coqui.ai
定价模式unknown
价格说明官网为coqui.ai,提供在线服务,但具体定价信息未明确,需进一步确认。
访问状态
是否开源是
开源协议MPL-2.0
主要语言Python
技术栈/模型deep-learning,glow-tts,hifigan,melgan,multi-speaker-tts,python,pytorch,speaker-encoder,speaker-encodings,speech,speech-synthesis,tacotron,text-to-speech,tts,tts-model,vocoder,voice-cloning,voice-conversion,voice-synthesis
GitHub 星标★ 46045
30天Star增速
HF 下载量
上线时间2020-05-20 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 7 步

环境要求

  • Python >= 3.9 且 < 3.12(官方在 Ubuntu 18.04 上测试)
  • 如只做语音合成推理,使用 pip 安装 PyPI 包即可
  • 如需写代码或训练模型,需克隆仓库并本地安装(含编译依赖)
  • 可选:已安装 Docker,使用官方镜像免安装体验
  • Windows 用户需参考社区提供的 CUDA 安装说明,官方未直接支持

安装与启动步骤

  1. 1安装 TTS 包

    只做语音合成的最简方式,直接从 PyPI 安装官方发布的 TTS 包。建议在虚拟环境中执行,避免污染系统环境。

    pip install TTS
  2. 2克隆并本地安装

    需要改代码或训练模型时使用。克隆仓库后在项目根目录以可编辑模式安装,方括号内为可选 extras,按需选择。

    git clone https://github.com/coqui-ai/TTS
    pip install -e .[all,dev,notebooks]
  3. 3Ubuntu 一键安装

    在 Ubuntu(Debian)系统上可用仓库自带 Makefile 安装系统依赖与项目,其他操作系统无此命令。

    make system-deps
    make install
  4. 4Docker 免安装启动

    不想装环境可直接跑官方 CPU 镜像,进入容器 bash 交互环境,并把容器 5002 端口映射到本机。

    docker run --rm -it -p 5002:5002 --entrypoint /bin/bash ghcr.io/coqui-ai/tts-cpu
  5. 5查看可用模型

    在 Docker 容器内查询官方预训练模型列表,从中挑一个模型名用于下一步启动服务。

    python3 TTS/server/server.py --list_models
  6. 6启动 TTS 服务器

    用选定的模型名启动服务,这里以多说话人英文 VITS 模型为例。命令需在容器内执行,或已在本地安装好 TTS 后执行。

    python3 TTS/server/server.py --model_name tts_models/en/vctk/vits
  7. 7代码调用合成

    在 Python 中导入 TTS 类并创建实例,用 tts_to_file 把文本合成到指定文件,示例为德语单说话人用法。

    import torch
    from TTS.api import TTS
    tts = TTS()
    tts.tts_to_file(text="Ich bin eine Testnachricht.", file_path=OUTPUT_PATH)

关键配置

配置项必填说明示例
--model_name是指定服务器加载的预训练模型名称tts_models/en/vctk/vits
--list_models否列出全部可用预训练模型,不加则为启动服务--list_models
-p 5002:5002否Docker 端口映射,宿主机与容器 5002 端口对应-p 5002:5002

如何确认成功

浏览器打开 http://[::1]:5002/ 即可看到并试用 TTS 服务器页面,说明启动成功。

常见问题

Q:只想做语音合成,需要克隆仓库吗?

A:不需要。README 明确说明只用官方发布模型做语音合成时,直接 pip install TTS 是最简单的方式。

Q:Windows 上能按官方步骤安装吗?

A:README 未给出 Windows 官方步骤,只链接到社区用户 GuyPaddock 在 Stack Overflow 上写的 CUDA 安装说明,需自行参考。

Q:怎么知道有哪些模型可选?

A:在容器或本地执行 python3 TTS/server/server.py --list_models,即可打印可用模型列表,再把模型名传给 --model_name。

Q:Docker 镜像支持 GPU 吗?

A:README 只演示了 CPU 镜像 ghcr.io/coqui-ai/tts-cpu,GPU 等更多细节需查看官方 docker_images 文档。

注意事项

  • Python 版本必须 >= 3.9 且 < 3.12,版本不符会导致安装或运行失败。
  • 执行 pip install -e .[all,dev,notebooks] 前需先进入克隆下来的 TTS 目录。
  • make system-deps 与 make install 仅适用于 Ubuntu(Debian)系统。
  • 后续两条 python3 TTS/server/server.py 命令需在 Docker 容器内执行。

核心亮点

  • 基于PyTorch,提供从文本到语音的完整深度学习流水线,涵盖数据预处理、模型训练到推理部署,研究生产双场景验证
  • 内置多种主流TTS模型(如Glow-TTS、HiFiGAN、MelGAN)及多说话人支持,便于对比实验和定制化开发
  • 社区活跃,星标超4.5万,文档与示例丰富,持续更新,生态成熟

不足之处

  • 中文语音支持依赖外部数据集和预训练模型,开箱即用的中文效果一般
  • 训练和推理资源消耗较高,对低算力设备不够友好
  • 文档/社区待观察

适用场景

  • 研究TTS算法对比与实验复现
  • 生产环境快速搭建多说话人语音合成服务
  • 教育或开发者学习TTS技术栈的参考实现

替代项目

Coqui TTS、ESPnet-TTS、MeloTTS

项目介绍

TTS 是音频音乐领域的开源项目,由 coqui-ai 开发,2020 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(46,045)位列前 1%,在音频音乐分类的 738 个项目里位列前 1%。

近 42 天,它的 GitHub 星标从 45,882 增加到 46,045,净增 163。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。官网为coqui.ai,提供在线服务,但具体定价信息未明确,需进一步确认。从国内网络环境看,当前已无法正常访问。

它主要面向的使用场景是:研究TTS算法对比与实验复现。同类可对比的替代方案包括 Coqui TTS、ESPnet-TTS、MeloTTS。

上一篇:GPT-SoVITS

下一篇:ChatTTS

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09