
ComfyUI-FL-Qwen3TTS
在ComfyUI里一键把文字变语音,还能克隆音色
ComfyUI-FL-Qwen3TTS 是把阿里 Qwen3-TTS 语音合成能力接入 ComfyUI 的节点插件,让用户在 ComfyUI 的可视化工作流里直接完成文字转语音。它解决的是传统 TTS 工具与图像/音频生成工作流割裂的问题:以往做视频配音、角色语音需要单独跑脚本或第三方服务,现在可以在同一张节点图里串联文本、语音克隆、语音设计和微调。核心能力包括:文本转语音节点、参考音频驱动的音色克隆、通过描述词设计新音色,以及配套的微调界面,方便针对特定说话人做定制。项目用 Python 编写,定位偏早期,适合已经在用 ComfyUI 做多模态创作、希望把配音环节也纳入统一流程的用户。
项目数据
使用教程
核心亮点
- 直接以 ComfyUI 节点形式提供,能和现有图像/视频工作流串联,无需切换工具
- 同时覆盖语音克隆、音色设计和微调三种用法,功能面比单一 TTS 节点更全
- 基于 Qwen3-TTS,中文语音合成效果有基础保障,适合中文内容创作
不足之处
- 项目处于早期,星标仅150,节点稳定性和边界情况处理待验证
- 依赖 Qwen3-TTS 模型权重与运行环境,显存和部署门槛不低
适用场景
- 为 AI 生成的短视频或动画角色批量配音
- 用少量参考音频克隆特定音色,制作有声内容
- 在 ComfyUI 工作流中做多角色对话语音的快速原型
替代项目
ComfyUI-F5-TTS、ComfyUI-GPT-SoVITS、ComfyUI-CosyVoice
项目介绍
同类项目推荐
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK: An Open-Source Foundational Model for Speech Generation and Editing