whisper-plus

让 Whisper 转写更快更省显存,长音频批量处理更顺手

WhisperPlus 是基于 OpenAI Whisper 的增强型语音识别工具,目标是让语音转文字更快、更准、更省资源。它针对原版 Whisper 推理慢、显存占用高、长音频处理不便等痛点做了优化,通常通过更高效的推理后端、批处理、量化或流式分段等方式加速,同时保留多语言识别与翻译能力。项目用 Python 编写,方便集成到现有音频处理或字幕生成流程中。核心能力包括:更快的转写速度、对长音频的切分与合并处理、可调节的模型与精度选项,以及更友好的命令行或 API 调用方式。适合需要批量转写、实时字幕、会议记录或播客整理的用户,在消费级显卡甚至 CPU 上也能获得比原版更可用的体验。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1958
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类语音识别
开发团队kadirnar
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 1958
30天Star增速
HF 下载量
上线时间2023-11-21 00:00:00
最近更新2026-09-18 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-23
浏览次数0

使用教程

难度:进阶 约 15 分钟 部署方式:库/依赖 4 步

环境要求

  • 已安装 Python 环境并可使用 pip
  • 网络可访问 PyPI 与 GitHub(需拉取 transformers 仓库)
  • 安装 flash-attn 建议具备 CUDA 环境与编译工具链
  • 运行示例需能访问 YouTube 链接以下载音频

安装与启动步骤

  1. 1安装核心库

    一条命令同时安装 whisperplus 和 GitHub 上的最新版 transformers,注意 transformers 是从 git 源安装。

    pip install whisperplus git+https://github.com/huggingface/transformers
  2. 2安装 flash-attn

    安装加速注意力实现,README 指定使用 --no-build-isolation,编译时间可能较长。

    pip install flash-attn --no-build-isolation
  3. 3下载音频

    调用 download_youtube_to_mp3 把 YouTube 音频转成 mp3,保存到 downloads 目录,返回音频路径。

    from whisperplus import download_youtube_to_mp3
    
    url = "https://www.youtube.com/watch?v=di3rHkEZuUw"
    audio_path = download_youtube_to_mp3(url, output_dir="downloads", filename="test")
  4. 4导入转写与量化模块

    导入 SpeechToTextPipeline 以及量化配置类,并按 README 示例设置 4bit HQQ 量化参数。

    from whisperplus import SpeechToTextPipeline
    from transformers import BitsAndBytesConfig, HqqConfig
    import torch
    
    hqq_config = HqqConfig(
        nbits=4,
        group_size=64,
        quant_zero=False,
    )

关键配置

配置项必填说明示例
nbitsHQQ 量化位数,README 示例为 4bit,可降低显存占用4
group_size量化分组大小,README 示例为 6464
quant_zero是否对零点做量化,README 示例为 FalseFalse
output_dir音频下载保存目录downloads
filename下载音频的文件名(不含扩展名)test

如何确认成功

运行下载代码后,检查 downloads 目录下是否生成 test.mp3,并能拿到返回的 audio_path。README 未给出完整转写与输出验证方式。

常见问题

Q:flash-attn 安装失败怎么办?

A:README 要求加 --no-build-isolation 安装,通常需要先装好 torch 并具备 CUDA 编译环境;若仍失败,可先跳过该步测试其余功能是否可用。

Q:为什么 transformers 要从 git 安装?

A:README 的安装命令直接指向 huggingface/transformers 仓库,说明示例依赖尚未发布到 PyPI 的最新特性,因此需从源码安装。

Q:可以从本地音频而不是 YouTube 转写吗?

A:README 示例只演示了 YouTube 链接下载后转写,本地音频的用法未在节选中给出,需查阅完整文档确认。

Q:模型从哪里获取?

A:README 指向 HuggingFace Model Hub(huggingface.co/models?search=whisper),模型由 transformers 按需下载。

注意事项

  • README 安装部分只在 pip 命令中出现,重复出现两次,请以完整版文档为准。
  • Usage 中的 SpeechToTextPipeline 调用代码在节选中被截断,实际转写参数需参考仓库完整 README。
  • HQQ 量化属于进阶用法,消费级显卡或 CPU 上可先不启用量化验证基本流程。
  • 下载 YouTube 音频需保证网络可达,且需遵守相应平台的使用条款。

核心亮点

  • 在 Whisper 基础上优化推理速度与显存占用,消费级硬件更易跑动
  • 支持长音频切分与合并,适合会议、播客等批量转写场景
  • Python 实现,便于集成到现有音频/字幕处理流程

不足之处

  • 项目仍在成长阶段,文档与周边生态相比原版 Whisper 尚不完善
  • 不同硬件与模型配置下的加速效果和稳定性需要自行验证

适用场景

  • 批量将播客或访谈音频转成文字稿
  • 为视频生成多语言字幕
  • 会议录音的快速转写与整理

替代项目

whisper.cpp、faster-whisper

项目介绍

whisper-plus 是语音识别领域的开源项目,由 kadirnar 开发,2023 年首次发布。

在全站 12,961 个收录项目中,它的 GitHub 星标数(1,958)位列前 30%,在语音识别分类中处于中上游。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-18。开源免费,需自行部署。

它主要面向的使用场景是:批量将播客或访谈音频转成文字稿。同类可对比的替代方案包括 whisper.cpp、faster-whisper。

上一篇:whisper.net

下一篇:WAAS

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1614 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3733 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13