whisper.cpp

在 CPU 上极速运行 Whisper,离线语音转文字不求人

whisper.cpp 是 OpenAI 的 Whisper 语音识别模型的高性能 C/C++ 移植版。它解决了 Whisper 原始 Python 实现依赖 PyTorch、部署重、推理慢的问题,能在 CPU 上高效运行,无需 GPU 或云服务。核心能力包括:支持多种 Whisper 模型(tiny 到 large)、流式音频处理、实时转录、多语言识别、以及针对不同硬件(如 ARM、x86)的优化。项目提供简洁的 C API,易于集成到桌面应用、嵌入式设备或服务器中。它采用 GGML 张量库,实现量化推理,大幅降低内存占用和延迟。whisper.cpp 让语音转文字功能真正落地到边缘设备,是本地化、隐私敏感场景的理想选择。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 54152
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类语音识别
开发团队ggml-org
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言C++
技术栈/模型inference,openai,speech-recognition,speech-to-text,transformer,whisper
GitHub 星标★ 54152
30天Star增速
HF 下载量
上线时间2022-09-25 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数5

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:入门 约 15 分钟 部署方式:本地安装 8 步

环境要求

  • 支持平台:macOS(Intel/Arm)、Linux/FreeBSD、Windows(MSVC),另有 iOS/Android/WASM 示例
  • 纯 CPU 即可推理,无需 GPU 或云服务(CUDA/ROCm/Vulkan/OpenVINO 等为可选加速)
  • 需要 Git 克隆仓库与 C/C++ 构建工具链(README 节选中构建命令被截断)
  • 需下载 ggml 格式模型文件,base 模型约 142 MiB 磁盘 / ~388 MB 内存
  • 自备或使用仓库内 samples/ 下的 wav 音频文件(如 samples/jfk.wav)

安装与启动步骤

  1. 1克隆仓库

    从 GitHub 拉取 whisper.cpp 源码到本地当前目录。

    git clone https://github.com/ggml-org/whisper.cpp.git
  2. 2进入项目目录

    切换到刚克隆下来的仓库根目录,后续命令都在此目录执行。

    cd whisper.cpp
  3. 3下载模型

    用仓库自带脚本下载 ggml 格式模型,base.en 约 142 MiB,体积小适合先跑通。

    sh ./models/download-ggml-model.sh base.en
  4. 4编译 whisper-cli

    README 节选中该段命令被截断,此处为标准 CMake 构建流程,请以仓库 README 构建章节为准。

    cmake -B build
    cmake --build build -j --config Release
  5. 5运行转录

    用 whisper-cli 指定模型和音频文件做语音转文字,支持中英文等多语言。

    ./build/bin/whisper-cli -m models/ggml-base.bin -f samples/jfk.wav
  6. 6量化模型推理(可选)

    内存紧张时改用 q5_0 量化模型,占用更低、速度更快,精度略降。

    ./build/bin/whisper-cli -m models/ggml-base.en-q5_0.bin ./samples/gb0.wav
  7. 7Docker 跑服务(可选)

    挂载模型目录并启动 whisper-server,映射 8080 端口;镜像需提前构建或获取。

    docker run -it --rm -p "8080:8080" 
      -v path/to/models:/models 
      whisper.cpp:main "whisper-server --host 127.0.0.1 -m /models/ggml-base.bin"
  8. 8Conan 安装(可选)

    用 Conan 包管理器安装预编译二进制或从源码构建 whisper-cpp。

    conan install --requires="whisper-cpp/[*]" --build=missing

关键配置

配置项必填说明示例
-m是指定 ggml 格式模型文件路径models/ggml-base.bin
-f是指定待转录的输入音频文件路径samples/jfk.wav
-t否推理使用的线程数,越大通常越快4
-tdrz否启用说话人转向检测,需搭配 tdrz 模型-tdrz
-m /models/ggml-base.bin否Docker 服务模式下容器内的模型路径/models/ggml-base.bin

如何确认成功

终端打印出带时间戳的转录文本,形如 [00:00:00.000 --> 00:00:03.800] Okay Houston, we've had a problem here.,即表示运行成功。

常见问题

Q:必须要有 GPU 吗?

A:不需要。whisper.cpp 支持纯 CPU 推理,macOS(Metal/Accelerate/Core ML)、NVIDIA、AMD ROCm、Vulkan 等加速均为可选。

Q:显存/内存不够怎么办?

A:换更小的模型或量化模型,例如 tiny 约 273 MB、base 约 388 MB 内存,量化版可用 ggml-base.en-q5_0.bin。

Q:没有音频文件测试怎么办?

A:README 使用仓库自带的 samples/jfk.wav、samples/gb0.wav、samples/a13.wav,克隆后可直接用。

Q:Docker 镜像从哪来?

A:README 节选只给出 docker run 用法,镜像名 whisper.cpp:main 需自行构建或获取,需提前把模型放到挂载的宿主机目录。

注意事项

  • README 节选中 whisper-cli 的构建命令段落被截断,实际构建参数请以仓库 README 的构建章节为准。
  • Docker 示例中 path/to/models 需替换为你本机的真实模型目录。
  • 模型文件不随仓库分发,必须通过 download-ggml-model.sh 下载或其他方式获取 ggml 格式模型。
  • 除 CLI 外仓库还提供 server、bench、WASM 等示例,以及 C 风格 API 便于集成。

核心亮点

  • 纯 C/C++ 实现,无 Python 依赖,部署轻量,启动快
  • 针对 CPU 深度优化,支持量化,内存占用低,推理速度远超原版
  • 跨平台支持(Windows/Linux/macOS/Android/iOS),易于嵌入各类应用

不足之处

  • 模型转换和编译配置对新手有一定门槛
  • 部分高级功能(如 VAD 集成)需自行实现

适用场景

  • 在树莓派或 NAS 上搭建离线语音助手
  • 为桌面应用添加本地录音转文字功能
  • 嵌入式设备上的实时语音命令识别

替代项目

Vosk、PaddleSpeech、whisper.cpp 的 Rust 绑定(whisper-rs)

项目介绍

whisper.cpp 是语音识别领域的开源项目,由 ggml-org 开发,2022 年首次发布。

在全站 13,655 个收录项目中,它的 GitHub 星标数(54,127)位列前 1%,在语音识别分类的 256 个项目里位列前 1%。

近 45 天,它的 GitHub 星标从 53,056 增加到 54,127,净增 1,071。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-02。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:在树莓派或NAS上搭建离线语音助手。同类可对比的替代方案包括 Vosk、PaddleSpeech、whisper.cpp 的 Rust 绑定(whisper-rs)。

上一篇:GigaAM

下一篇:whisperX

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1623 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3812 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11852 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5662 2026-08-13