whisper-timestamped

给Whisper识别结果加上精准词级时间戳和置信度

whisper-timestamped 是一个基于 OpenAI Whisper 的语音识别增强工具,专门为多语言自动语音识别提供词级时间戳和置信度。它解决了标准 Whisper 模型输出时间戳不够精确、无法对齐到每个单词的问题。核心能力包括:对 Whisper 生成的音频片段进行重新对齐,利用动态时间规整(DTW)和交叉注意力机制,为每个单词生成准确的时间戳;同时输出每个单词的置信度分数,帮助用户评估识别结果的可靠性。项目支持多语言,兼容 Whisper 的多种模型大小,并提供了简单的 Python API 和命令行工具,便于集成到现有语音处理流程中。通过改进时间戳精度,它显著提升了字幕生成、语音分析、关键词检索等下游任务的效果。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2850
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类语音识别
开发团队linto-ai
所属国家
官网地址
定价模式free
价格说明开源免费,MIT许可证
访问状态
是否开源是
开源协议AGPL-3.0
主要语言Python
技术栈/模型asr,attention-is-all-you-need,attention-mechanism,attention-model,attention-network,attention-seq2seq,attention-visualization,deep-learning,machine-learning,multilingual-models,python,python3,pytorch,speaker-diarization,speech,speech-processing,speech-recognition,speech-to-text,transformers,whisper
GitHub 星标★ 2850
30天Star增速
HF 下载量
上线时间2023-01-13 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-18
浏览次数11

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:入门 约 15 分钟 部署方式:库/依赖 8 步

环境要求

  • Python 3(版本 ≥ 3.7,官方推荐至少 3.9)
  • ffmpeg(安装方式参见 OpenAI Whisper 仓库说明)
  • 如需 GPU 加速,需相应 CUDA 依赖(CPU 用户可用轻量安装)
  • Docker(仅在用 Docker 方式安装时需要)

安装与启动步骤

  1. 1安装 ffmpeg

    whisper-timestamped 依赖 ffmpeg 处理音频,README 要求先装好,具体安装方法见 OpenAI Whisper 仓库说明。

  2. 2CPU 版 torch(可选)

    没有 GPU 或不用 GPU 时,先装轻量版 torch 与 torchaudio,再装 whisper-timestamped,可省去 CUDA 依赖。

    pip3 install 
         torch==1.13.1+cpu 
         torchaudio==0.13.1+cpu 
         -f https://download.pytorch.org/whl/torch_stable.html
  3. 3pip 安装主包

    最简安装方式,一条命令即可装好 whisper-timestamped 及其依赖。

    pip3 install whisper-timestamped
  4. 4源码安装

    克隆仓库后运行 setup.py 安装,适合需要改代码或查看示例的场景。

    git clone https://github.com/linto-ai/whisper-timestamped
    cd whisper-timestamped/
    python3 setup.py install
  5. 5构建 Docker 镜像

    构建约 9GB 的完整镜像,包含 GPU 相关依赖;需先克隆仓库并进入目录。

    git clone https://github.com/linto-ai/whisper-timestamped
    cd whisper-timestamped/
    docker build -t whisper_timestamped:latest .
  6. 6构建 CPU 镜像

    使用 Dockerfile.cpu 构建约 3.5GB 的轻量 CPU 镜像,适合无 GPU 环境。

    git clone https://github.com/linto-ai/whisper-timestamped
    cd whisper-timestamped/
    docker build -t whisper_timestamped_cpu:latest -f Dockerfile.cpu .
  7. 7开启 VAD 转写

    静音段易让 Whisper 产生幻觉文本,加上 --vad True 可先做语音活动检测再识别。

    whisper_timestamped --vad True ...
  8. 8更换 VAD 方法

    默认 VAD 为 silero,新版 silero 可能误报,可换成旧版 silero 或 auditok。

    whisper_timestamped --vad silero:v3.1 ...
    whisper_timestamped --vad auditok ...

关键配置

配置项必填说明示例
vad否转写前做语音活动检测,避免静音段产生幻觉文本True
vad否指定 VAD 实现版本,可选 silero 旧版或 auditoksilero:v3.1
plot否命令行绘图展示 VAD 结果与词对齐情况True

如何确认成功

命令行运行 whisper_timestamped 能得到带词级时间戳的识别结果;加 --plot 可显示 VAD 与对齐图。

常见问题

Q:没有 GPU 怎么办?

A:先按 README 的轻量安装命令装 CPU 版 torch 和 torchaudio,再安装 whisper-timestamped;也可用 Dockerfile.cpu 构建约 3.5GB 的 CPU 镜像。

Q:为什么还要单独装 ffmpeg?

A:README 明确把 ffmpeg 列为安装前提,音频读取与解码依赖它,安装方法见 OpenAI Whisper 仓库说明。

Q:识别结果出现静音段的假文本?

A:这是 Whisper 的幻觉现象,可开启 VAD(--vad True)把语音段拼接后再转写,或改用 silero:v3.1、auditok 等 VAD 方法。

Q:默认用哪种 VAD?

A:默认使用 silero;README 指出最新版 silero 在部分音频上误报较多,可换用旧版本或 auditok。

注意事项

  • Python 版本要求 ≥ 3.7,官方推荐至少 3.9。
  • 轻量 CPU 版 torch/torchaudio 必须在安装 whisper-timestamped 之前装好。
  • 完整 Docker 镜像约 9GB,CPU 镜像约 3.5GB,请预留磁盘空间。
  • README 未给出统一的启动成功判断命令,建议自行准备一段音频测试转写输出。

核心亮点

  • 词级时间戳精度高,显著优于原生Whisper输出
  • 提供单词置信度,便于过滤低质量识别结果
  • 支持多语言,API简洁,易于集成到现有项目

不足之处

  • 依赖OpenAI Whisper模型,推理速度相对较慢
  • 文档/社区待观察

适用场景

  • 生成高精度字幕文件(SRT/VTT)
  • 语音关键词检索与对齐
  • 语音数据分析与说话人分段

替代项目

faster-whisper、whisperX、stable-ts

项目介绍

whisper-timestamped 是语音识别领域的开源项目,由 linto-ai 开发,2023 年首次发布。

在全站 13,559 个收录项目中,它的 GitHub 星标数(2,850)位列前 30%,在语音识别分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-28。开源免费,MIT许可证。

它主要面向的使用场景是:生成高精度字幕文件(SRT/VTT)。同类可对比的替代方案包括 faster-whisper、whisperX、stable-ts。

上一篇:WhisperLiveKit

下一篇:RealtimeSTT

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1619 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3786 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11848 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5659 2026-08-13