ComfyUI-FL-Qwen3TTS

在ComfyUI里一键把文字变语音,还能克隆音色

ComfyUI-FL-Qwen3TTS 是把阿里 Qwen3-TTS 语音合成能力接入 ComfyUI 的节点插件,让用户在 ComfyUI 的可视化工作流里直接完成文字转语音。它解决的是传统 TTS 工具与图像/音频生成工作流割裂的问题:以往做视频配音、角色语音需要单独跑脚本或第三方服务,现在可以在同一张节点图里串联文本、语音克隆、语音设计和微调。核心能力包括:文本转语音节点、参考音频驱动的音色克隆、通过描述词设计新音色,以及配套的微调界面,方便针对特定说话人做定制。项目用 Python 编写,定位偏早期,适合已经在用 ComfyUI 做多模态创作、希望把配音环节也纳入统一流程的用户。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 150
维护状态 活跃
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队filliptm
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署ComfyUI节点
访问状态
是否开源
开源协议
主要语言Python
技术栈/模型
GitHub 星标★ 150
30天Star增速
HF 下载量
上线时间2026-01-26 00:00:00
最近更新2026-09-14 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数1

使用教程

核心亮点

  • 直接以 ComfyUI 节点形式提供,能和现有图像/视频工作流串联,无需切换工具
  • 同时覆盖语音克隆、音色设计和微调三种用法,功能面比单一 TTS 节点更全
  • 基于 Qwen3-TTS,中文语音合成效果有基础保障,适合中文内容创作

不足之处

  • 项目处于早期,星标仅150,节点稳定性和边界情况处理待验证
  • 依赖 Qwen3-TTS 模型权重与运行环境,显存和部署门槛不低

适用场景

  • 为 AI 生成的短视频或动画角色批量配音
  • 用少量参考音频克隆特定音色,制作有声内容
  • 在 ComfyUI 工作流中做多角色对话语音的快速原型

替代项目

ComfyUI-F5-TTS、ComfyUI-GPT-SoVITS、ComfyUI-CosyVoice

项目介绍

ComfyUI-FL-Qwen3TTS 是一个音频音乐领域的开源项目,官方简介:Qwen3-TTS text-to-speech nodes for ComfyUI with voice cloning, voice design, and fine-tuning UI。项目使用 Python 开发,在 GitHub 上获得 150 星标。

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1238 2026-08-09
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 244 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1070 2026-09-13