TTS-WebUI

一个界面玩转二十多种语音与音乐生成模型

TTS-WebUI 是一个集成了多种主流语音与音频生成模型的一站式 Web 界面,基于 Gradio 和 React 构建。它解决了用户在不同 TTS、语音克隆、音乐生成等工具间切换繁琐、配置复杂的问题,通过统一的扩展架构,将 ACE-Step、GPT-SoVITS、CosyVoice、XTTSv2、OpenVoice、MusicGen 等二十余个模型整合在同一界面中。核心能力包括文本转语音、语音克隆、声音转换、音乐生成、音频修复等,支持模型间灵活切换与参数调节,并提供 API 接口便于集成。项目采用 TypeScript 开发,模块化设计,方便用户按需加载扩展,适合研究、创作及开发场景。

开源 unknown 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3273
维护状态 较活跃
是否开源 是
定价模式 unknown

项目数据

分类音频音乐
开发团队rsxdalv
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议MIT
主要语言TypeScript
技术栈/模型ace-step,ai,audio-generation,cosyvoice,generative-ai,generator,gradio,music,musicgen,openai-api,openvoice,rvc,styletts2,text-to-speech,tortoise-tts,tts,vocos
GitHub 星标★ 3273
30天Star增速
HF 下载量
上线时间2023-04-27 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数9

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 6 步

环境要求

  • Python 3.10 或 3.11(暂不支持 3.12)
  • git
  • PyTorch
  • ffmpeg(需支持 vorbis)
  • 磁盘空间:基础安装约 10.7 GB,每个模型另需 2-8 GB

安装与启动步骤

  1. 1准备环境依赖

    确认已安装 git、Python 3.10/3.11、PyTorch、ffmpeg(含 vorbis),并预留约 10.7 GB 以上磁盘空间。

  2. 2克隆仓库

    从 GitHub 克隆 TTS-WebUI 源码,并进入项目目录后再执行后续命令。

    git clone https://github.com/rsxdalv/tts-webui.git
    cd tts-webui
  3. 3安装依赖

    在项目根目录用 pip 安装 requirements.txt 中的全部 Python 依赖,耗时较长请耐心等待。

    pip install -r requirements.txt
  4. 4启动服务

    不加 React 界面,直接启动 Gradio 后端服务,适合只使用后端界面的场景。

    python server.py --no-react
  5. 5构建 React UI

    进入 react-ui 安装依赖并打包,再回到根目录启动,即可同时使用完整前端界面。

    cd react-ui
    npm install
    npm run build
    cd ..
    python server.py
  6. 6改用 Docker

    也可拉取官方镜像并用 Docker Compose 后台启动,首次启动会自动下载模型。

    docker pull ghcr.io/rsxdalv/tts-webui:main
    docker compose up -d

关键配置

配置项必填说明示例
TTS_PORT否Gradio 后端的服务端口,默认 7770。7770
UI_PORT否React 前端的服务端口,默认 3000。3000

如何确认成功

浏览器访问 http://localhost:7770(Gradio 后端)与 http://localhost:3000(React UI)能正常打开即为启动成功。

常见问题

Q:可以用 Python 3.12 吗?

A:不可以,README 明确说明需 Python 3.10 或 3.11,3.12 暂不支持。

Q:用安装脚本前需要自己建虚拟环境吗?

A:不需要。启动脚本会自行创建 conda 环境和 Python 虚拟环境,从其他 venv 启动反而可能破坏脚本。

Q:Docker 启动后很久没有输出?

A:容器首次运行会在后台下载模型,需要等待。用 docker logs tts-webui 查看下载进度。

Q:安装日志在哪里看?

A:使用安装器时,输出日志保存在 installer_scripts/output.log 文件中。

注意事项

  • NodeJS 22.9.0 仅在需要 React UI 时安装,属可选项。
  • Docker 中使用 CUDA 需要先安装 NVIDIA Container Toolkit。
  • 项目也提供 Installer 安装包,解压后运行 start_tts_webui.bat(Windows)或 start_tts_webui.sh(Linux/macOS)并按提示选择 GPU 即可。
  • 首次启动会下载模型,出结果前请耐心等待。

核心亮点

  • 集成 20+ 主流 TTS/语音/音乐模型,免去逐个部署的麻烦
  • 基于 Gradio + React 的现代化 UI,交互流畅且支持扩展
  • 提供 OpenAI 兼容 API,便于接入现有应用

不足之处

  • 依赖多个重型模型,本地运行资源占用高
  • 文档/社区待观察

适用场景

  • 快速对比不同 TTS 模型的合成效果
  • 搭建统一的语音生成服务供团队或应用调用
  • 音乐创作者利用 MusicGen、AudioGen 等生成背景音乐或音效

替代项目

Coqui TTS、OpenVoice、GPT-SoVITS

项目介绍

TTS-WebUI 是音频音乐领域的开源项目,由 rsxdalv 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,273)位列前 30%,在音频音乐分类的 738 个项目里位列前 7%。

近 42 天,它的 GitHub 星标从 3,236 增加到 3,273,净增 37。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。从国内网络环境看,当前已无法正常访问。

它主要面向的使用场景是:快速对比不同TTS模型的合成效果。同类可对比的替代方案包括 Coqui TTS、OpenVoice、GPT-SoVITS。

上一篇:Applio

下一篇:elevenlabs-python

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09