docker-whisperX

一条命令跑通带说话人分离的词级时间戳语音转写

docker-whisperX 是 WhisperX 语音识别工具的官方 Docker 镜像构建项目,通过 Dockerfile 与 CI 流程把 WhisperX 及其依赖(PyTorch、faster-whisper、pyannote 说话人分离模型等)打包成开箱即用的容器镜像。WhisperX 本身解决的是 OpenAI Whisper 在长音频转写中时间戳不准、无说话人区分的问题:它用强制对齐把词级时间戳精度提升到毫秒级,并接入说话人分离模型,输出带说话人标签的转写文本。本项目让用户不必手动处理 CUDA、cuDNN、Python 依赖冲突,一条 docker run 即可在 GPU 或 CPU 上跑完整流水线,同时通过 CI 自动构建和测试保证镜像可用性,适合需要批量转写会议、访谈、播客并区分说话人的工程团队。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 456
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类语音识别
开发团队jim60105
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源是
开源协议MIT
主要语言Dockerfile
技术栈/模型asr,docker-image,dockerfile,speech,speech-recognition,speech-to-text,whisper
GitHub 星标★ 456
30天Star增速
HF 下载量
上线时间2023-08-26 00:00:00
最近更新2026-09-27 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-28
浏览次数0

使用教程

核心亮点

  • 把 WhisperX 复杂的 CUDA、PyTorch、pyannote 依赖全部预装好,省去环境配置时间
  • CI 自动构建并测试镜像,减少依赖升级导致的镜像不可用风险
  • 支持 GPU 加速与词级时间戳、说话人分离,输出可直接用于字幕和会议纪要

不足之处

  • 镜像体积较大,拉取和存储成本高
  • 仅提供镜像封装,WhisperX 本身的模型选择与参数调优仍需自行研究

适用场景

  • 批量转写会议录音并按发言人切分纪要
  • 为播客或视频生成带精确时间轴的字幕
  • 对访谈音频做词级对齐以便后续检索与剪辑

替代项目

whisper、whisper.cpp

项目介绍

docker-whisperX 是语音识别领域的开源项目,由 jim60105 开发,2023 年首次发布。

它收录于语音识别分类,该分类目前共有 216 个项目,GitHub 星标数为 456。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-27。开源免费,需自行部署。

它主要面向的使用场景是:批量转写会议录音并按发言人切分纪要。同类可对比的替代方案包括 whisper、whisper.cpp。

上一篇:opentypeless

下一篇:没有了!

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1617 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3767 2026-08-10
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5659 2026-08-13
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11841 2026-08-26