Whisper 是语音识别领域的开源项目,由 Const-me 开发,2023 年首次发布。
在全站 12,961 个收录项目中,它的 GitHub 星标数(10,668)位列前 5%,在语音识别分类的 192 个项目里位列前 7%。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。开源免费,需自行部署。
它主要面向的使用场景是:本地会议录音转文字,保护隐私不传云端。同类可对比的替代方案包括 whisper、faster-whisper。

本地离线跑 Whisper,语音转文字不联网也快
Whisper.cpp 是 OpenAI Whisper 语音识别模型的 C/C++ 高性能推理实现,通过手写 GPGPU 内核与量化技术,让原本依赖 PyTorch 的模型能在消费级硬件上离线运行。它解决了云端 ASR 的隐私、延迟与成本问题:音频无需上传,本地即可转写。核心能力包括:支持 ggml 量化(q5_0、q8_0 等)显著降低显存占用,可在 NVIDIA/AMD/Apple Silicon 上加速;提供流式与批处理接口,附带命令行工具和多种语言绑定;支持多语言识别、翻译与时间戳输出。项目以单文件、零依赖为设计目标,便于嵌入桌面、移动端或边缘设备,是本地语音转文字场景中被广泛采用的基础设施。
1下载发行包
到本仓库 Releases 区下载 WhisperDesktop.zip,不要从第三方网站下载。
2解压压缩包
把 ZIP 解压到任意目录,下面命令中的路径可替换成你自己的下载路径。
Expand-Archive -Path "$env:USERPROFILEDownloadsWhisperDesktop.zip" -DestinationPath "$env:USERPROFILEDownloadsWhisperDesktop" -Force3运行程序
进入解压目录双击 WhisperDesktop.exe,或在命令行执行以下命令启动。
.WhisperDesktop.exe4下载识别模型
首次启动界面会提示下载模型,README 推荐 ggml-medium.bin,约 1.42GB。
5转写音频文件
在文件转写界面选择本地音频文件,由程序完成后台识别并输出文字。
6实时麦克风转写
另一个界面可采集麦克风实时音频,进行实时转写或翻译。
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
识别模型 | 是 | 首次启动时选择并下载的 ggml 模型文件 | ggml-medium.bin |
WhisperDesktop.exe 正常打开,首个界面提示下载模型,即表示启动成功。
Q:该选哪个模型?
A:README 推荐 ggml-medium.bin(约 1.42GB),因为作者主要用这个模型做过测试。
Q:从哪里下载才安全?
A:只从本仓库的 Releases 区下载。网站 whisperdesktop.com 冒充本项目,不要信任。
Q:支持哪些平台?
A:本仓库是 whisper.cpp 的 Windows 移植版,提供的是 Windows 桌面程序。
Q:能实时转写吗?
A:可以,程序有单独界面用于采集麦克风音频并实时转写或翻译。
whisper、faster-whisper
Whisper 是语音识别领域的开源项目,由 Const-me 开发,2023 年首次发布。
在全站 12,961 个收录项目中,它的 GitHub 星标数(10,668)位列前 5%,在语音识别分类的 192 个项目里位列前 7%。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。开源免费,需自行部署。
它主要面向的使用场景是:本地会议录音转文字,保护隐私不传云端。同类可对比的替代方案包括 whisper、faster-whisper。
上一篇:whisper
下一篇:awesome-whisper
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper