ComfyUI-Whisper

在 ComfyUI 里拖个节点,自动给视频加字幕

ComfyUI-Whisper 是一个将 OpenAI Whisper 语音识别能力集成到 ComfyUI 工作流中的开源节点插件。它解决了在 ComfyUI 中直接为视频添加字幕和转写音频的需求,让用户无需离开熟悉的节点式界面即可完成语音到文本的转换。核心能力包括:加载 Whisper 模型(支持多种规模和语言)、将音频文件或视频中的音轨转写为带时间戳的文本、生成并嵌入字幕(如 SRT 格式),以及将字幕作为条件输入用于后续的图像或视频生成流程。通过 ComfyUI 的可视化节点编排,用户可以灵活组合音频处理、字幕生成和视频生成节点,实现自动化多媒体创作。项目基于 Python,依赖 ComfyUI 和 Whisper,目前处于早期阶段,功能聚焦但扩展潜力大。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 268
维护状态 低维护
是否开源
定价模式 free

项目数据

分类图像生成
开发团队yuvraj108c
所属国家
官网地址
定价模式free
价格说明开源项目,本地部署,完全免费
访问状态
是否开源
开源协议NOASSERTION
主要语言Python
技术栈/模型comfyui,stable-diffusion,whisper-ai
GitHub 星标★ 268
30天Star增速
HF 下载量
上线时间2024-01-24 00:00:00
最近更新2026-09-20 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 原生集成 ComfyUI,节点化操作,无需命令行即可完成音频转写和字幕生成
  • 支持多语言和多种 Whisper 模型,用户可按需选择精度与速度
  • 输出带时间戳的文本,可直接生成 SRT 字幕,方便后续编辑或嵌入视频

不足之处

  • 项目处于早期阶段,功能相对单一,可能缺少高级音频处理选项
  • 文档和社区支持待观察,示例和教程较少

适用场景

  • 为 AI 生成的视频自动添加字幕,提升内容可访问性
  • 在 ComfyUI 工作流中批量转写音频素材,用于数据集准备
  • 结合图像生成节点,制作带语音解说的动态视频内容

替代项目

ComfyUI-VideoHelperSuite、Whisper-WebUI、faster-whisper

项目介绍

ComfyUI-Whisper 是语音识别领域的开源项目,由 yuvraj108c 开发,2024 年首次发布。

它收录于语音识别分类,该分类目前共有 212 个项目,GitHub 星标数为 268。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-20。本地部署,完全免费。

它主要面向的使用场景是:为AI生成的视频自动添加字幕,提升内容可访问性。同类可对比的替代方案包括 ComfyUI-VideoHelperSuite、Whisper-WebUI、faster-whisper。

上一篇:whisper_dictation

下一篇:StreamSpeech

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13