whisper-plus 是语音识别领域的开源项目,由 kadirnar 开发,2023 年首次发布。
在全站 12,961 个收录项目中,它的 GitHub 星标数(1,958)位列前 30%,在语音识别分类中处于中上游。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-18。开源免费,需自行部署。
它主要面向的使用场景是:批量将播客或访谈音频转成文字稿。同类可对比的替代方案包括 whisper.cpp、faster-whisper。

让 Whisper 转写更快更省显存,长音频批量处理更顺手
WhisperPlus 是基于 OpenAI Whisper 的增强型语音识别工具,目标是让语音转文字更快、更准、更省资源。它针对原版 Whisper 推理慢、显存占用高、长音频处理不便等痛点做了优化,通常通过更高效的推理后端、批处理、量化或流式分段等方式加速,同时保留多语言识别与翻译能力。项目用 Python 编写,方便集成到现有音频处理或字幕生成流程中。核心能力包括:更快的转写速度、对长音频的切分与合并处理、可调节的模型与精度选项,以及更友好的命令行或 API 调用方式。适合需要批量转写、实时字幕、会议记录或播客整理的用户,在消费级显卡甚至 CPU 上也能获得比原版更可用的体验。
1安装核心库
一条命令同时安装 whisperplus 和 GitHub 上的最新版 transformers,注意 transformers 是从 git 源安装。
pip install whisperplus git+https://github.com/huggingface/transformers2安装 flash-attn
安装加速注意力实现,README 指定使用 --no-build-isolation,编译时间可能较长。
pip install flash-attn --no-build-isolation3下载音频
调用 download_youtube_to_mp3 把 YouTube 音频转成 mp3,保存到 downloads 目录,返回音频路径。
from whisperplus import download_youtube_to_mp3
url = "https://www.youtube.com/watch?v=di3rHkEZuUw"
audio_path = download_youtube_to_mp3(url, output_dir="downloads", filename="test")4导入转写与量化模块
导入 SpeechToTextPipeline 以及量化配置类,并按 README 示例设置 4bit HQQ 量化参数。
from whisperplus import SpeechToTextPipeline
from transformers import BitsAndBytesConfig, HqqConfig
import torch
hqq_config = HqqConfig(
nbits=4,
group_size=64,
quant_zero=False,
)| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
nbits | 是 | HQQ 量化位数,README 示例为 4bit,可降低显存占用 | 4 |
group_size | 是 | 量化分组大小,README 示例为 64 | 64 |
quant_zero | 是 | 是否对零点做量化,README 示例为 False | False |
output_dir | 否 | 音频下载保存目录 | downloads |
filename | 否 | 下载音频的文件名(不含扩展名) | test |
运行下载代码后,检查 downloads 目录下是否生成 test.mp3,并能拿到返回的 audio_path。README 未给出完整转写与输出验证方式。
Q:flash-attn 安装失败怎么办?
A:README 要求加 --no-build-isolation 安装,通常需要先装好 torch 并具备 CUDA 编译环境;若仍失败,可先跳过该步测试其余功能是否可用。
Q:为什么 transformers 要从 git 安装?
A:README 的安装命令直接指向 huggingface/transformers 仓库,说明示例依赖尚未发布到 PyPI 的最新特性,因此需从源码安装。
Q:可以从本地音频而不是 YouTube 转写吗?
A:README 示例只演示了 YouTube 链接下载后转写,本地音频的用法未在节选中给出,需查阅完整文档确认。
Q:模型从哪里获取?
A:README 指向 HuggingFace Model Hub(huggingface.co/models?search=whisper),模型由 transformers 按需下载。
whisper.cpp、faster-whisper
whisper-plus 是语音识别领域的开源项目,由 kadirnar 开发,2023 年首次发布。
在全站 12,961 个收录项目中,它的 GitHub 星标数(1,958)位列前 30%,在语音识别分类中处于中上游。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-18。开源免费,需自行部署。
它主要面向的使用场景是:批量将播客或访谈音频转成文字稿。同类可对比的替代方案包括 whisper.cpp、faster-whisper。
上一篇:whisper.net
下一篇:WAAS
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper