ComfyUI-VoxCPM

在 ComfyUI 里拖拽节点,即可生成高表现力语音并克隆任意声音。

ComfyUI-VoxCPM 是一个为 ComfyUI 设计的音频生成节点,专注于高表现力的语音合成和零样本声音克隆。它解决了在 ComfyUI 工作流中集成先进 TTS 能力的问题,让用户无需编写代码即可通过可视化节点实现文本到语音的转换,并能克隆任意参考声音。核心能力包括:基于 VoxCPM 模型的语音生成、支持零样本声音克隆、提供高表现力的语音输出,并可与 ComfyUI 的其他节点(如图像、视频)组合,构建多模态生成流程。该项目处于早期阶段,但为音频创作者和 ComfyUI 用户提供了便捷的语音生成入口。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 509
维护状态 维护中
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队wildminder
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型ai-voice,audio,comfyui-node,t2s,text-to-speech,tts,voice-cloning,voice-generation
GitHub 星标★ 509
30天Star增速
HF 下载量
上线时间2025-09-17 00:00:00
最近更新2026-09-23 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 零样本声音克隆:无需训练,仅凭几秒参考音频即可克隆音色,实用性强。
  • 无缝集成 ComfyUI:作为原生节点,可与其他图像/视频节点组合,构建多模态工作流。
  • 高表现力语音:基于 VoxCPM 模型,语音自然度和情感表达优于传统 TTS。

不足之处

  • 早期项目,文档和示例可能不完善,社区支持待观察。
  • 依赖 VoxCPM 模型,模型体积和推理速度可能影响部署效率。

适用场景

  • 在 ComfyUI 中为视频生成配音或旁白,实现音画同步生成。
  • 快速克隆特定人声,用于个性化语音助手或内容创作。
  • 作为多模态 AI 工作流的一部分,结合图像生成和语音合成制作完整多媒体内容。

替代项目

ComfyUI-ChatTTS、ComfyUI-F5-TTS、ComfyUI-GTTS

项目介绍

ComfyUI-VoxCPM 是音频音乐领域的开源项目,由 wildminder 开发,2025 年首次发布。

它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 509。

项目仍在小幅维护中,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:在ComfyUI中为视频生成配音或旁白,实现音画同步生成。同类可对比的替代方案包括 ComfyUI-ChatTTS、ComfyUI-F5-TTS、ComfyUI-GTTS。

上一篇:e2-tts-pytorch

下一篇:aspeak

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09