faster-whisper

把 Whisper 语音转文字提速数倍,CPU 也能跑

faster-whisper 是 OpenAI Whisper 语音识别模型的高性能重实现,底层用 CTranslate2 推理引擎替代原始 PyTorch 实现。它解决的核心问题是:原生 Whisper 在 CPU 和普通 GPU 上推理慢、显存占用高,难以落地到实时字幕、批量转写等生产场景。项目通过模型量化(int8、int8_float16、float16 等)和算子优化,在保持识别准确率基本不变的前提下,把推理速度提升数倍,显存占用大幅下降。核心能力包括:支持多语言语音转文字、带时间戳输出、VAD 语音活动检测过滤静音、批量并行转写,并提供与 openai-whisper 高度相似的 Python API,迁移成本低。它兼容 Whisper 各尺寸模型(tiny 到 large-v3),也支持 distil-whisper 等蒸馏版本,是当前本地部署语音识别最常用的方案之一。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 25677
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类语音识别
开发团队SYSTRAN
所属国家
官网地址
定价模式free
价格说明开源免费,基于MIT许可证
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型deep-learning,inference,openai,quantization,speech-recognition,speech-to-text,transformer,whisper
GitHub 星标★ 25677
30天Star增速
HF 下载量
上线时间2023-02-11 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-03
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:入门 约 10 分钟 部署方式:库/依赖 6 步

环境要求

  • Python 环境与 pip(用于安装 faster-whisper)
  • GPU 场景需可用的 CUDA 环境(cuBLAS、cuDNN 9 系库)
  • 用 pip 安装 CUDA 依赖的方式仅支持 Linux
  • Docker 方案可使用镜像 nvidia/cuda:12.3.2-cudnn9-runtime-ubuntu22.04

安装与启动步骤

  1. 1安装 faster-whisper

    README 推荐从 PyPI 直接安装该模块,这是最简方式,装完即可在 Python 中导入使用。

    pip install faster-whisper
  2. 2安装 CUDA 运行库

    Linux 上可选用 pip 补充 cuBLAS 与 cuDNN 9 系库;不用 GPU 可跳过这一步。

    pip install nvidia-cublas-cu12 nvidia-cudnn-cu12==9.*
  3. 3设置库搜索路径

    用 pip 装 CUDA 库时,必须在启动 Python 之前设置 LD_LIBRARY_PATH,否则会找不到动态库。

    export LD_LIBRARY_PATH=`python3 -c 'import os; import nvidia.cublas.lib; import nvidia.cudnn.lib; print(os.path.dirname(nvidia.cublas.lib.__file__) + ":" + os.path.dirname(nvidia.cudnn.lib.__file__))'`
  4. 4加载模型并选精度

    README 示例片段:GPU 用 float16;GPU 省显存或 CPU 上跑的示例为 int8,需自行补全导入与变量。

    # Run on GPU with FP16
    model = WhisperModel(model_size, device="cuda", compute_type="float16")
    
    # or run on GPU with INT8
    
    # or run on CPU with INT8
  5. 5改用 master 分支

    如需最新代码,README 给出从 GitHub master 压缩包强制重装的方式,会覆盖已装版本。

    pip install --force-reinstall "faster-whisper @ https://github.com/SYSTRAN/faster-whisper/archive/refs/heads/master.tar.gz"
  6. 6安装指定提交

    README 另给出按 commit 哈希安装的方式,适合锁定某个确定版本复现问题。

    pip install --force-reinstall "faster-whisper @ https://github.com/SYSTRAN/faster-whisper/archive/a4f1cc8f11433e454c3934442b5e1a4ed5e865c3.tar.gz"

关键配置

配置项必填说明示例
model_size是传给 WhisperModel 的模型规格,README 基准中以 Large-v2 为例large-v2
device否模型运行设备,GPU 用 cuda,CPU 则相应切换cuda
compute_type否计算精度,float16 走 GPU FP16,int8 可省显存或用于 CPUfloat16

如何确认成功

构造 WhisperModel 时无报错、能正常转写音频即成功;若找不到 cuBLAS/cuDNN 会报动态库错误。

常见问题

Q:运行时报错找不到 cuBLAS 或 cuDNN 怎么办?

A:在 Linux 上用 pip 安装 nvidia-cublas-cu12 和 nvidia-cudnn-cu12==9.*,并在启动 Python 前设置 LD_LIBRARY_PATH 指向这两个库目录。

Q:想用最新代码而不是 PyPI 版本?

A:执行 pip install --force-reinstall "faster-whisper @ https://github.com/SYSTRAN/faster-whisper/archive/refs/heads/master.tar.gz" 从 master 分支安装。

Q:不想自己装 CUDA 库有什么办法?

A:使用 NVIDIA 官方镜像 nvidia/cuda:12.3.2-cudnn9-runtime-ubuntu22.04,cuBLAS 与 cuDNN 已预装在该镜像中。

Q:如何在 CPU 上获得更快速度?

A:README 说明在 CPU 和 GPU 上使用 8 位量化都能进一步提升效率,CPU 场景使用 compute_type="int8"。

注意事项

  • 用 pip 安装 CUDA 依赖仅适用于 Linux,且必须在启动 Python 前设置 LD_LIBRARY_PATH。
  • GPU 上可用 float16,也可用 int8 量化降低显存占用;CPU 上使用 int8。
  • README 中的加载示例是代码片段,需自行补全导入语句与变量后再运行。

核心亮点

  • 相比原生 Whisper 推理速度提升明显,CPU 上 int8 量化后可用性大幅提高
  • 显存和内存占用更低,小显存显卡也能跑 large 模型
  • API 与 openai-whisper 接近,替换成本低,支持时间戳和 VAD 过滤

不足之处

  • 依赖 CTranslate2,模型需转换格式,首次使用有额外准备步骤
  • 极端量化(如 int8)下部分语种或口音准确率会有可感知下降

适用场景

  • 本地批量把会议、播客录音转成带时间戳的文字稿
  • 给视频生成实时或准实时字幕
  • 在无 GPU 的服务器上做多语言语音转写服务

替代项目

whisper.cpp、openai-whisper、whisperX

项目介绍

faster-whisper 是语音识别领域的开源项目,由 SYSTRAN 开发,2023 年首次发布。

在全站 13,591 个收录项目中,它的 GitHub 星标数(25,677)位列前 2%,在语音识别分类的 249 个项目里位列前 2%。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-01。开源免费,基于MIT许可证。

它主要面向的使用场景是:本地批量把会议、播客录音转成带时间戳的文字稿。同类可对比的替代方案包括 whisper.cpp、openai-whisper、whisperX。

上一篇:phonon

下一篇:whisper-flow

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1619 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3786 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11851 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5659 2026-08-13