whisper-ctranslate2 是语音识别领域的开源项目,由 Softcatala 开发,2023 年首次发布。
在全站 13,655 个收录项目中,它的 GitHub 星标数(1,357)位列前 30%,在语音识别分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-04。开源免费,需自行部署。
它主要面向的使用场景是:本地批量把会议录音转成文字稿。同类可对比的替代方案包括 openai-whisper、faster-whisper。

用 CTranslate2 加速 Whisper,本地转写更快更省显存
whisper-ctranslate2 是一个基于 CTranslate2 推理引擎的 Whisper 命令行客户端,接口与 OpenAI 官方 whisper 客户端保持兼容。它解决的核心问题是:原版 Whisper 在 CPU 或普通 GPU 上推理速度慢、显存占用高,而该项目通过 CTranslate2 的量化与优化算子,把模型推理速度提升数倍,同时显著降低内存占用。核心能力包括:支持多种模型尺寸(tiny 到 large-v3)、多种量化精度(int8、float16 等)、批量推理、VAD 语音活动检测、词级时间戳、多种输出格式(txt、srt、vtt、json 等),并可选择 CPU 或 CUDA 设备运行。对于需要本地批量转写音频、又不想依赖云端 API 的用户,它提供了接近原版使用体验但更高效的替代方案,安装后只需把 whisper 命令替换为 whisper-ctranslate2 即可迁移。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
1安装命令行客户端
使用 pip 安装最新稳定版 whisper-ctranslate2,安装后即可在终端调用同名命令。
pip install whisper-ctranslate22(可选)拉取 Docker 镜像
不使用本地 Python 环境时,可直接拉取官方预构建镜像,镜像内已包含 small、medium、large-v2 模型。
docker pull ghcr.io/softcatala/whisper-ctranslate2:latest3(可选)容器内转录音频
把当前目录挂载到容器 /srv/files/,用镜像内模型转录音频并输出到同一目录;无 GPU 时去掉 --gpus 参数。
docker run --gpus "device=0" -v "$(pwd)":/srv/files/ -it ghcr.io/softcatala/whisper-ctranslate2:latest /srv/files/audio.mp3 --output_dir /srv/files/4执行语音转录
命令与 OpenAI Whisper 完全一致,把音频文件路径换成你自己的文件,并用 --model 选择模型尺寸(如 medium)。
whisper-ctranslate2 inaguracio2011.mp3 --model medium5翻译为英文
加 --task translate 可把源语言语音直接翻译成英文;注意该任务仅支持英文作为目标语言。
whisper-ctranslate2 inaguracio2011.mp3 --model medium --task translate6查看全部可用选项
运行 --help 可看到所有支持的参数说明,包括模型、输出格式、VAD、时间戳等。
whisper-ctranslate2 --help| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
--model | 否 | 指定使用的 Whisper 模型尺寸,如 tiny、small、medium、large-v2 等 | medium |
--task | 否 | transcribe 为转录原文,translate 为翻译成英文 | translate |
--output_dir | 否 | 指定输出文件保存目录,不指定则输出到当前目录 | /srv/files/ |
--gpus | 否 | Docker 参数,授予容器 GPU 访问权限;无 GPU 时删除该项 | device=0 |
执行 whisper-ctranslate2 --help 能正常打印帮助信息;转录命令结束后在输出目录生成结果文件即成功。
Q:没有 GPU 可以使用吗?
A:可以。使用 Docker 时删除 --gpus "device=0" 参数即可;本地 pip 安装方式也能在 CPU 上运行,只是速度较慢。
Q:Docker 镜像里有哪些模型?
A:官方镜像已内置 small、medium 和 large-v2 三个模型,可直接在容器内使用,无需额外下载。
Q:翻译任务支持哪些目标语言?
A:--task translate 只能把源语言语音翻译成英文,英文是唯一支持的目标语言。
Q:如何知道有哪些可用参数?
A:运行 whisper-ctranslate2 --help,会列出全部支持的选项及其说明。
openai-whisper、faster-whisper
whisper-ctranslate2 是语音识别领域的开源项目,由 Softcatala 开发,2023 年首次发布。
在全站 13,655 个收录项目中,它的 GitHub 星标数(1,357)位列前 30%,在语音识别分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-04。开源免费,需自行部署。
它主要面向的使用场景是:本地批量把会议录音转成文字稿。同类可对比的替代方案包括 openai-whisper、faster-whisper。
上一篇:myna
下一篇:没有了!
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper