Whisper

本地离线跑 Whisper,语音转文字不联网也快

Whisper.cpp 是 OpenAI Whisper 语音识别模型的 C/C++ 高性能推理实现,通过手写 GPGPU 内核与量化技术,让原本依赖 PyTorch 的模型能在消费级硬件上离线运行。它解决了云端 ASR 的隐私、延迟与成本问题:音频无需上传,本地即可转写。核心能力包括:支持 ggml 量化(q5_0、q8_0 等)显著降低显存占用,可在 NVIDIA/AMD/Apple Silicon 上加速;提供流式与批处理接口,附带命令行工具和多种语言绑定;支持多语言识别、翻译与时间戳输出。项目以单文件、零依赖为设计目标,便于嵌入桌面、移动端或边缘设备,是本地语音转文字场景中被广泛采用的基础设施。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 10668
维护状态 活跃
是否开源
定价模式 free

项目数据

分类语音识别
开发团队Const-me
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源
开源协议MPL-2.0
主要语言C++
技术栈/模型
GitHub 星标★ 10668
30天Star增速
HF 下载量
上线时间2023-01-07 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-23
浏览次数0

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 6 步

环境要求

  • Windows 操作系统(本仓库是 whisper.cpp 的 Windows 移植版)
  • 已从本仓库 Releases 下载 WhisperDesktop.zip
  • 磁盘空间充足:推荐模型 ggml-medium.bin 约 1.42GB
  • 可正常访问 GitHub Releases 页面

安装与启动步骤

  1. 1下载发行包

    到本仓库 Releases 区下载 WhisperDesktop.zip,不要从第三方网站下载。

  2. 2解压压缩包

    把 ZIP 解压到任意目录,下面命令中的路径可替换成你自己的下载路径。

    Expand-Archive -Path "$env:USERPROFILEDownloadsWhisperDesktop.zip" -DestinationPath "$env:USERPROFILEDownloadsWhisperDesktop" -Force
  3. 3运行程序

    进入解压目录双击 WhisperDesktop.exe,或在命令行执行以下命令启动。

    .WhisperDesktop.exe
  4. 4下载识别模型

    首次启动界面会提示下载模型,README 推荐 ggml-medium.bin,约 1.42GB。

  5. 5转写音频文件

    在文件转写界面选择本地音频文件,由程序完成后台识别并输出文字。

  6. 6实时麦克风转写

    另一个界面可采集麦克风实时音频,进行实时转写或翻译。

关键配置

配置项必填说明示例
识别模型首次启动时选择并下载的 ggml 模型文件ggml-medium.bin

如何确认成功

WhisperDesktop.exe 正常打开,首个界面提示下载模型,即表示启动成功。

常见问题

Q:该选哪个模型?

A:README 推荐 ggml-medium.bin(约 1.42GB),因为作者主要用这个模型做过测试。

Q:从哪里下载才安全?

A:只从本仓库的 Releases 区下载。网站 whisperdesktop.com 冒充本项目,不要信任。

Q:支持哪些平台?

A:本仓库是 whisper.cpp 的 Windows 移植版,提供的是 Windows 桌面程序。

Q:能实时转写吗?

A:可以,程序有单独界面用于采集麦克风音频并实时转写或翻译。

注意事项

  • 本项目自 2023 年起未再更新,作者已转向商业后继产品。
  • whisperdesktop.com 为冒充站点,其下载链接可能被替换为恶意软件。
  • 模型文件较大,首次使用需预留下载时间和磁盘空间。

核心亮点

  • 纯 C/C++ 实现,无 Python/PyTorch 依赖,可嵌入桌面与移动端
  • 支持 ggml 量化与 GPU 加速,消费级显卡即可实时转写
  • 提供多语言绑定和命令行工具,集成门槛低

不足之处

  • 模型转换与量化流程对新手仍有一定学习成本
  • 不同后端(CUDA/Metal/Vulkan)性能与兼容性差异需自行调优

适用场景

  • 本地会议录音转文字,保护隐私不传云端
  • 为桌面/移动应用嵌入离线语音输入功能
  • 批量处理播客、视频字幕生成与翻译

替代项目

whisper、faster-whisper

项目介绍

Whisper 是语音识别领域的开源项目,由 Const-me 开发,2023 年首次发布。

在全站 12,961 个收录项目中,它的 GitHub 星标数(10,668)位列前 5%,在语音识别分类的 192 个项目里位列前 7%。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。开源免费,需自行部署。

它主要面向的使用场景是:本地会议录音转文字,保护隐私不传云端。同类可对比的替代方案包括 whisper、faster-whisper。

上一篇:whisper

下一篇:awesome-whisper

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1614 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3733 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13