whisper

音频丢进去,多语言文字直接出来

Whisper 是 OpenAI 开源的通用语音识别模型,基于大规模弱监督数据训练,主打多语言、抗噪、无需微调即可直接使用。它把语音转写、语音翻译、语种识别等任务统一到一个序列到序列的 Transformer 模型中,输入音频即可输出文字。项目提供多种规格模型(tiny 到 large),用户可根据算力与精度需求选择,并支持 Python 调用、命令行使用,也常被集成到各类字幕、会议记录、播客转写工具中。相比传统 ASR 需要针对场景调参和微调,Whisper 在口音、背景噪声、专业术语等复杂条件下表现更稳健,开箱即用,极大降低了语音识别应用的开发门槛。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 109475
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类语音识别
开发团队openai
所属国家
官网地址
定价模式free
价格说明开源免费,MIT 许可证,可自行部署
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型
GitHub 星标★ 109475
30天Star增速
HF 下载量
上线时间2022-09-16 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-23
浏览次数0

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 8 步

环境要求

  • Python 3.8-3.11(官方测试环境为 Python 3.9.9)
  • PyTorch(官方测试用 1.10.1,兼容较新版本)
  • 系统需安装 ffmpeg 命令行工具
  • 可联网环境(用于下载模型权重)

安装与启动步骤

  1. 1安装 ffmpeg

    Whisper 依赖系统命令行工具 ffmpeg 处理音频,README 说明它可通过大多数包管理器安装,请按你的操作系统用对应包管理器装好。

  2. 2安装 Whisper 包

    用 pip 下载并安装最新发布版 Whisper,会自动带上 tiktoken 等 Python 依赖。建议在虚拟环境中执行。

    pip install -U openai-whisper
  3. 3从仓库安装(可选)

    如果想用 GitHub 仓库最新提交版本,改用这条命令,会拉取仓库代码并安装其 Python 依赖。两种方式选一种即可。

    pip install git+https://github.com/openai/whisper.git
  4. 4升级到仓库最新版

    已装过旧版时,用这条命令强制重装仓库最新提交版本而不动依赖。

    pip install --upgrade --no-deps --force-reinstall git+https://github.com/openai/whisper.git
  5. 5查看可用参数

    列出所有命令行选项,能正常打印帮助说明就代表安装成功。

    whisper --help
  6. 6转写音频文件

    用默认 turbo 模型转写一个或多个音频文件,模型权重会在首次运行时自动下载,输出文字到终端。

    whisper audio.flac audio.mp3 audio.wav --model turbo
  7. 7指定语种转写

    处理非英语语音时用 --language 指定语种,可提升转写准确率;语种列表见仓库 tokenizer.py。

    whisper japanese.wav --language Japanese
  8. 8翻译为非英语到英语

    把非英语语音翻译成英文,需使用多语言模型并加 --task translate,turbo 模型不能用于翻译任务。

    whisper japanese.wav --model medium --language Japanese --task translate

关键配置

配置项必填说明示例
--model选择模型规格,默认 turbo,可选 tiny/base/small/medium/large 等medium
--language指定音频语种,处理非英语语音时建议显式指定Japanese
--task任务类型,translate 表示翻译成英语,默认转写translate

如何确认成功

执行 whisper --help 能正常列出全部选项,说明安装成功;转写音频后终端会直接输出识别文本。

常见问题

Q:turbo 模型能用来做翻译吗?

A:不能。README 明确指出 turbo 模型未针对翻译任务训练,即使指定 --task translate 也会返回原语言,翻译请改用 tiny、base、small、medium 或 large 等多语言模型。

Q:翻译效果最好用哪个模型?

A:README 建议使用 medium 或 large 模型可获得最佳翻译结果,命令中加 --task translate 并指定源语言。

Q:首次运行很慢是什么原因?

A:首次使用某个规格模型时会自动下载模型权重,之后再次运行会复用本地缓存,速度明显变快。

Q:怎么查看支持哪些语种?

A:可查看仓库中的 whisper/tokenizer.py 文件,里面列出了全部可用语种名称。

注意事项

  • 转写英语用默认 turbo 模型即可,但 turbo 不支持翻译任务。
  • 必须先在系统上安装 ffmpeg,否则无法处理音频文件。
  • 模型权重在首次运行时下载,需保证网络可用。
  • Python 3.8-3.11 与较新版本 PyTorch 均可运行,官方测试环境为 Python 3.9.9 + PyTorch 1.10.1。

核心亮点

  • 多语言与抗噪能力强,口音、背景噪声场景下仍可开箱使用
  • 模型规格从 tiny 到 large 齐全,可按算力与精度灵活取舍
  • 生态成熟,社区封装、教程和下游工具极其丰富

不足之处

  • 大模型推理显存与算力要求高,实时场景成本明显
  • 长音频需自行切分处理,时间戳与说话人分离能力有限

适用场景

  • 播客、访谈音频批量转写成文字稿
  • 会议录音实时或离线生成字幕与纪要
  • 视频字幕生成与多语言翻译辅助

替代项目

faster-whisper、whisper.cpp

项目介绍

whisper 是语音识别领域的开源项目,由 openai 开发,2022 年首次发布。

在全站 12,961 个收录项目中,它的 GitHub 星标数(109,475)位列前 1%,在语音识别分类的 192 个项目里位列前 1%。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。开源免费,MIT 许可证,可自行部署。

它主要面向的使用场景是:播客、访谈音频批量转写成文字稿。同类可对比的替代方案包括 faster-whisper、whisper.cpp。

上一篇:transcribe-anything

下一篇:Whisper

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1614 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3733 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13