ComfyUI-GPT_SoVITS 是音频音乐领域的开源项目,由 AIFSH 开发,2024 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 254。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-15。免费使用,需自行部署。
它主要面向的使用场景是:在ComfyUI中为生成的数字人视频添加配音。同类可对比的替代方案包括 ComfyUI-F5-TTS、ComfyUI-ChatTTS、ComfyUI-tts。

在ComfyUI里拖拽节点,就能克隆声音生成语音
ComfyUI-GPT_SoVITS 是一个将 GPT-SoVITS 集成到 ComfyUI 的自定义节点,让用户能在 ComfyUI 的可视化工作流中直接进行声音克隆和文本转语音(TTS)。它解决了 ComfyUI 用户需要切换工具才能完成语音合成的痛点,将复杂的语音克隆流程简化为节点拖拽和连线操作。核心能力包括:加载 GPT-SoVITS 模型、上传参考音频进行声音克隆、输入文本生成语音,并支持与 ComfyUI 其他节点(如图像生成)组合使用,从而构建多模态工作流。项目基于 Python 开发,目前处于早期阶段,星标数 251,适合对 ComfyUI 生态熟悉且需要集成语音功能的开发者和创作者。
ComfyUI-F5-TTS、ComfyUI-ChatTTS、ComfyUI-tts
ComfyUI-GPT_SoVITS 是音频音乐领域的开源项目,由 AIFSH 开发,2024 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 254。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-15。免费使用,需自行部署。
它主要面向的使用场景是:在ComfyUI中为生成的数字人视频添加配音。同类可对比的替代方案包括 ComfyUI-F5-TTS、ComfyUI-ChatTTS、ComfyUI-tts。
上一篇:edge-tts-go
下一篇:WG-WaveNet
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK: An Open-Source Foundational Model for Speech Generation and Editing
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···