whisper-ctranslate2

用 CTranslate2 加速 Whisper,本地转写更快更省显存

whisper-ctranslate2 是一个基于 CTranslate2 推理引擎的 Whisper 命令行客户端,接口与 OpenAI 官方 whisper 客户端保持兼容。它解决的核心问题是:原版 Whisper 在 CPU 或普通 GPU 上推理速度慢、显存占用高,而该项目通过 CTranslate2 的量化与优化算子,把模型推理速度提升数倍,同时显著降低内存占用。核心能力包括:支持多种模型尺寸(tiny 到 large-v3)、多种量化精度(int8、float16 等)、批量推理、VAD 语音活动检测、词级时间戳、多种输出格式(txt、srt、vtt、json 等),并可选择 CPU 或 CUDA 设备运行。对于需要本地批量转写音频、又不想依赖云端 API 的用户,它提供了接近原版使用体验但更高效的替代方案,安装后只需把 whisper 命令替换为 whisper-ctranslate2 即可迁移。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1357
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类语音识别
开发团队Softcatala
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型openai-,openai-whisper,speech-recognition,speech-to-text,whisper
GitHub 星标★ 1357
30天Star增速
HF 下载量
上线时间2023-03-17 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-05
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:入门 约 10 分钟 部署方式:命令行工具 6 步

环境要求

  • Python 环境(可用 pip 安装包,README 未指定最低版本)
  • 可选:NVIDIA GPU 及驱动,用于 Docker 的 --gpus 参数加速
  • 可选:已安装 Docker,用于容器方式运行
  • 磁盘空间:模型体积较大(Docker 镜像已内置 small、medium、large-v2 模型)

安装与启动步骤

  1. 1安装命令行客户端

    使用 pip 安装最新稳定版 whisper-ctranslate2,安装后即可在终端调用同名命令。

    pip install whisper-ctranslate2
  2. 2(可选)拉取 Docker 镜像

    不使用本地 Python 环境时,可直接拉取官方预构建镜像,镜像内已包含 small、medium、large-v2 模型。

    docker pull ghcr.io/softcatala/whisper-ctranslate2:latest
  3. 3(可选)容器内转录音频

    把当前目录挂载到容器 /srv/files/,用镜像内模型转录音频并输出到同一目录;无 GPU 时去掉 --gpus 参数。

    docker run --gpus "device=0" -v "$(pwd)":/srv/files/ -it ghcr.io/softcatala/whisper-ctranslate2:latest /srv/files/audio.mp3 --output_dir /srv/files/
  4. 4执行语音转录

    命令与 OpenAI Whisper 完全一致,把音频文件路径换成你自己的文件,并用 --model 选择模型尺寸(如 medium)。

    whisper-ctranslate2 inaguracio2011.mp3 --model medium
  5. 5翻译为英文

    加 --task translate 可把源语言语音直接翻译成英文;注意该任务仅支持英文作为目标语言。

    whisper-ctranslate2 inaguracio2011.mp3 --model medium --task translate
  6. 6查看全部可用选项

    运行 --help 可看到所有支持的参数说明,包括模型、输出格式、VAD、时间戳等。

    whisper-ctranslate2 --help

关键配置

配置项必填说明示例
--model否指定使用的 Whisper 模型尺寸,如 tiny、small、medium、large-v2 等medium
--task否transcribe 为转录原文,translate 为翻译成英文translate
--output_dir否指定输出文件保存目录,不指定则输出到当前目录/srv/files/
--gpus否Docker 参数,授予容器 GPU 访问权限;无 GPU 时删除该项device=0

如何确认成功

执行 whisper-ctranslate2 --help 能正常打印帮助信息;转录命令结束后在输出目录生成结果文件即成功。

常见问题

Q:没有 GPU 可以使用吗?

A:可以。使用 Docker 时删除 --gpus "device=0" 参数即可;本地 pip 安装方式也能在 CPU 上运行,只是速度较慢。

Q:Docker 镜像里有哪些模型?

A:官方镜像已内置 small、medium 和 large-v2 三个模型,可直接在容器内使用,无需额外下载。

Q:翻译任务支持哪些目标语言?

A:--task translate 只能把源语言语音翻译成英文,英文是唯一支持的目标语言。

Q:如何知道有哪些可用参数?

A:运行 whisper-ctranslate2 --help,会列出全部支持的选项及其说明。

注意事项

  • 命令行接口与 OpenAI Whisper 保持兼容,迁移时原命令基本可直接替换。
  • Docker 方式需用 -v "$(pwd)":/srv/files/ 把本地目录挂载进容器,否则容器内找不到音频文件。
  • 若常用镜像中未包含的模型,可自行构建派生镜像预载模型,或用 Docker 卷持久化共享模型文件。
  • README 未列出 Python 最低版本要求,若安装或运行报错请先检查 Python 与 pip 环境。

核心亮点

  • 推理速度比原版 whisper 快数倍,CPU 上也能实用
  • 显存和内存占用明显降低,支持 int8 量化
  • 命令行参数与 OpenAI 官方客户端兼容,迁移成本低

不足之处

  • 依赖 CTranslate2 与模型转换,首次配置比原版稍复杂
  • 部分新模型或新特性跟进可能滞后于官方 whisper

适用场景

  • 本地批量把会议录音转成文字稿
  • 为视频生成 srt/vtt 字幕
  • 在无 GPU 的服务器上做语音转写

替代项目

openai-whisper、faster-whisper

项目介绍

whisper-ctranslate2 是语音识别领域的开源项目,由 Softcatala 开发,2023 年首次发布。

在全站 13,655 个收录项目中,它的 GitHub 星标数(1,357)位列前 30%,在语音识别分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-04。开源免费,需自行部署。

它主要面向的使用场景是:本地批量把会议录音转成文字稿。同类可对比的替代方案包括 openai-whisper、faster-whisper。

上一篇:myna

下一篇:没有了!

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1622 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3805 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11852 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5661 2026-08-13