whisper 是语音识别领域的开源项目,由 openai 开发,2022 年首次发布。
在全站 12,961 个收录项目中,它的 GitHub 星标数(109,475)位列前 1%,在语音识别分类的 192 个项目里位列前 1%。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。开源免费,MIT 许可证,可自行部署。
它主要面向的使用场景是:播客、访谈音频批量转写成文字稿。同类可对比的替代方案包括 faster-whisper、whisper.cpp。

音频丢进去,多语言文字直接出来
Whisper 是 OpenAI 开源的通用语音识别模型,基于大规模弱监督数据训练,主打多语言、抗噪、无需微调即可直接使用。它把语音转写、语音翻译、语种识别等任务统一到一个序列到序列的 Transformer 模型中,输入音频即可输出文字。项目提供多种规格模型(tiny 到 large),用户可根据算力与精度需求选择,并支持 Python 调用、命令行使用,也常被集成到各类字幕、会议记录、播客转写工具中。相比传统 ASR 需要针对场景调参和微调,Whisper 在口音、背景噪声、专业术语等复杂条件下表现更稳健,开箱即用,极大降低了语音识别应用的开发门槛。
1安装 ffmpeg
Whisper 依赖系统命令行工具 ffmpeg 处理音频,README 说明它可通过大多数包管理器安装,请按你的操作系统用对应包管理器装好。
2安装 Whisper 包
用 pip 下载并安装最新发布版 Whisper,会自动带上 tiktoken 等 Python 依赖。建议在虚拟环境中执行。
pip install -U openai-whisper3从仓库安装(可选)
如果想用 GitHub 仓库最新提交版本,改用这条命令,会拉取仓库代码并安装其 Python 依赖。两种方式选一种即可。
pip install git+https://github.com/openai/whisper.git4升级到仓库最新版
已装过旧版时,用这条命令强制重装仓库最新提交版本而不动依赖。
pip install --upgrade --no-deps --force-reinstall git+https://github.com/openai/whisper.git5查看可用参数
列出所有命令行选项,能正常打印帮助说明就代表安装成功。
whisper --help6转写音频文件
用默认 turbo 模型转写一个或多个音频文件,模型权重会在首次运行时自动下载,输出文字到终端。
whisper audio.flac audio.mp3 audio.wav --model turbo7指定语种转写
处理非英语语音时用 --language 指定语种,可提升转写准确率;语种列表见仓库 tokenizer.py。
whisper japanese.wav --language Japanese8翻译为非英语到英语
把非英语语音翻译成英文,需使用多语言模型并加 --task translate,turbo 模型不能用于翻译任务。
whisper japanese.wav --model medium --language Japanese --task translate| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
--model | 否 | 选择模型规格,默认 turbo,可选 tiny/base/small/medium/large 等 | medium |
--language | 否 | 指定音频语种,处理非英语语音时建议显式指定 | Japanese |
--task | 否 | 任务类型,translate 表示翻译成英语,默认转写 | translate |
执行 whisper --help 能正常列出全部选项,说明安装成功;转写音频后终端会直接输出识别文本。
Q:turbo 模型能用来做翻译吗?
A:不能。README 明确指出 turbo 模型未针对翻译任务训练,即使指定 --task translate 也会返回原语言,翻译请改用 tiny、base、small、medium 或 large 等多语言模型。
Q:翻译效果最好用哪个模型?
A:README 建议使用 medium 或 large 模型可获得最佳翻译结果,命令中加 --task translate 并指定源语言。
Q:首次运行很慢是什么原因?
A:首次使用某个规格模型时会自动下载模型权重,之后再次运行会复用本地缓存,速度明显变快。
Q:怎么查看支持哪些语种?
A:可查看仓库中的 whisper/tokenizer.py 文件,里面列出了全部可用语种名称。
faster-whisper、whisper.cpp
whisper 是语音识别领域的开源项目,由 openai 开发,2022 年首次发布。
在全站 12,961 个收录项目中,它的 GitHub 星标数(109,475)位列前 1%,在语音识别分类的 192 个项目里位列前 1%。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。开源免费,MIT 许可证,可自行部署。
它主要面向的使用场景是:播客、访谈音频批量转写成文字稿。同类可对比的替代方案包括 faster-whisper、whisper.cpp。
下一篇:Whisper
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper