TTS-Audio-Suite

在 ComfyUI 里拖拽节点,本地跑多种 TTS 和声音克隆

TTS-Audio-Suite 是一个 ComfyUI 自定义节点集成包,旨在为本地多引擎、多语言的文本转语音(TTS)和语音转换(VC)提供一站式解决方案。它解决了在 ComfyUI 中难以灵活调用多种先进 TTS 模型的问题,将 RVC、Echo-TTS、Qwen3-TTS、Cozy Voice 3、Step Audio EditX、IndexTTS-2、Chatterbox、F5-TTS、Higgs Audio 2/3 和 VibeVoice 等众多引擎统一封装为易用的节点。核心能力包括:支持无限文本长度、SRT 字幕时间轴生成、多角色对话支持,以及丰富的音频处理工具(如剪辑、混音、格式转换等)。用户无需编写代码,即可在 ComfyUI 的可视化工作流中自由组合不同 TTS 引擎,实现高质量语音合成、声音克隆和音频编辑,特别适合内容创作者、配音演员和 AI 应用开发者快速构建个性化语音方案。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1212
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队diodiogod
所属国家
官网地址
定价模式free
价格说明开源项目,本地部署,完全免费,无付费版本。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型ai-audio,audio,audio-editing,audio-generation,audio-processing,chatterbox,comfyui,cozy-voice-3,echo-tts,f5,f5-tts,higgs-audio,indextts-2,qwen3-tts,rvc,text-to-speech,tts,vibevoice,voice-cloning,voice-conversion
GitHub 星标★ 1212
30天Star增速
HF 下载量
上线时间2025-08-06 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 7 步

环境要求

  • 已安装并可正常运行的 ComfyUI(便携版或 venv/conda 版均可)
  • Git 命令行工具,用于克隆仓库
  • Python 环境与 ComfyUI 一致(便携版用其自带 python_embeded)
  • 可选:安装 FFmpeg 以获得更好的音频处理效果
  • 可选:Python 3.13 也受支持,MediaPipe 不可用时自动改用 OpenSeeFace

安装与启动步骤

  1. 1进入节点目录

    先切换到 ComfyUI 的 custom_nodes 目录,所有自定义节点都装在这里。

    cd ComfyUI/custom_nodes
  2. 2克隆项目仓库

    从 GitHub 拉取 TTS-Audio-Suite 源码,并进入项目目录。

    git clone https://github.com/diodiogod/TTS-Audio-Suite.git
    cd TTS-Audio-Suite
  3. 3升级打包工具

    官方强烈建议先升级 pip、setuptools、wheel,可减少 s3tokenizer 等依赖的安装报错。

    python -m pip install --upgrade pip setuptools wheel
  4. 4运行智能安装脚本

    安装脚本会自动处理依赖冲突和 Python 版本兼容。venv/conda 用户先激活 ComfyUI 环境再执行 python install.py。

    python install.py
  5. 5便携版专用安装

    ComfyUI 便携版必须使用其自带解释器:Windows 为 ......python_embededpython.exe,Linux/Mac 为 ../../../python_embeded/python.exe。

    ......python_embededpython.exe install.py
  6. 6重启 ComfyUI

    重启后节点才会加载,在节点列表里应能看到 TTS Audio Suite 分类。

  7. 7导入示例工作流

    下载并拖入 ChatterBox 集成工作流即可开始生成,模型在首次使用时自动下载。

如何确认成功

重启 ComfyUI 后,在节点菜单中能看到 TTS Audio Suite 节点分类,即表示安装成功。

常见问题

Q:安装时 s3tokenizer 报错怎么办?

A:先在该环境执行 python -m pip install --upgrade pip setuptools wheel,再运行 python install.py。Python 3.10(如 Stability Matrix)较易出现该问题。

Q:Python 3.13 能用吗?

A:完全支持。当 MediaPipe 不可用时,系统会自动改用 OpenSeeFace 做口型动作分析。

Q:模型需要手动下载吗?

A:不需要。所有引擎的模型在第一次使用时自动下载;离线或手动安装请参考 docs/MODEL_DOWNLOAD_SOURCES.md 与 docs/MODEL_LAYOUTS.md。

Q:便携版安装脚本该用哪个 Python?

A:必须用 ComfyUI 便携包自带的 python_embeded 里的解释器,否则依赖会装到错误环境。

Q:通过 ComfyUI Manager 安装后还要做什么?

A:Manager 可能自动装依赖,仍建议进入节点目录并激活 ComfyUI 环境后运行 python install.py 确认依赖完整。

注意事项

  • 官方建议为 TTS-Audio-Suite 单独建一个干净的 ComfyUI 便携安装,安装更顺、初始化更快。
  • 有依赖问题时先激活正确的 ComfyUI 虚拟环境再运行 install.py,否则包会装错位置。
  • FFmpeg 为可选项,但推荐安装以获得高质量音频拉伸效果。
  • 首次使用会下载模型,建议保证网络通畅或提前按文档准备离线模型目录。

核心亮点

  • 集成 11 种主流 TTS/VC 引擎,覆盖多语言和多种音色风格,选择丰富
  • 支持无限文本长度和 SRT 字幕生成,适合长音频和视频配音场景
  • 提供多角色对话支持,可轻松制作多人对话音频

不足之处

  • 依赖 ComfyUI 环境,对新手有一定使用门槛
  • 不同引擎的模型下载和配置步骤可能较繁琐
  • 文档/社区待观察

适用场景

  • 视频配音与多角色对话生成
  • 有声书或播客的长文本语音合成
  • 声音克隆与个性化语音定制

替代项目

Coqui TTS、Bark、XTTS-v2

项目介绍

TTS-Audio-Suite 是音频音乐领域的开源项目,由 diodiogod 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,212)位列前 30%,在音频音乐分类的 738 个项目里位列前 15%。

近 42 天,它的 GitHub 星标从 1,149 增加到 1,212,净增 63。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。本地部署,完全免费,无付费版本。

它主要面向的使用场景是:视频配音与多角色对话生成。同类可对比的替代方案包括 Coqui TTS、Bark、XTTS-v2。

上一篇:Irodori-TTS

下一篇:Cognitive-Speech-TTS

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09