whisper-timestamped 是语音识别领域的开源项目,由 linto-ai 开发,2023 年首次发布。
在全站 13,559 个收录项目中,它的 GitHub 星标数(2,850)位列前 30%,在语音识别分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-28。开源免费,MIT许可证。
它主要面向的使用场景是:生成高精度字幕文件(SRT/VTT)。同类可对比的替代方案包括 faster-whisper、whisperX、stable-ts。

给Whisper识别结果加上精准词级时间戳和置信度
whisper-timestamped 是一个基于 OpenAI Whisper 的语音识别增强工具,专门为多语言自动语音识别提供词级时间戳和置信度。它解决了标准 Whisper 模型输出时间戳不够精确、无法对齐到每个单词的问题。核心能力包括:对 Whisper 生成的音频片段进行重新对齐,利用动态时间规整(DTW)和交叉注意力机制,为每个单词生成准确的时间戳;同时输出每个单词的置信度分数,帮助用户评估识别结果的可靠性。项目支持多语言,兼容 Whisper 的多种模型大小,并提供了简单的 Python API 和命令行工具,便于集成到现有语音处理流程中。通过改进时间戳精度,它显著提升了字幕生成、语音分析、关键词检索等下游任务的效果。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
1安装 ffmpeg
whisper-timestamped 依赖 ffmpeg 处理音频,README 要求先装好,具体安装方法见 OpenAI Whisper 仓库说明。
2CPU 版 torch(可选)
没有 GPU 或不用 GPU 时,先装轻量版 torch 与 torchaudio,再装 whisper-timestamped,可省去 CUDA 依赖。
pip3 install
torch==1.13.1+cpu
torchaudio==0.13.1+cpu
-f https://download.pytorch.org/whl/torch_stable.html3pip 安装主包
最简安装方式,一条命令即可装好 whisper-timestamped 及其依赖。
pip3 install whisper-timestamped4源码安装
克隆仓库后运行 setup.py 安装,适合需要改代码或查看示例的场景。
git clone https://github.com/linto-ai/whisper-timestamped
cd whisper-timestamped/
python3 setup.py install5构建 Docker 镜像
构建约 9GB 的完整镜像,包含 GPU 相关依赖;需先克隆仓库并进入目录。
git clone https://github.com/linto-ai/whisper-timestamped
cd whisper-timestamped/
docker build -t whisper_timestamped:latest .6构建 CPU 镜像
使用 Dockerfile.cpu 构建约 3.5GB 的轻量 CPU 镜像,适合无 GPU 环境。
git clone https://github.com/linto-ai/whisper-timestamped
cd whisper-timestamped/
docker build -t whisper_timestamped_cpu:latest -f Dockerfile.cpu .7开启 VAD 转写
静音段易让 Whisper 产生幻觉文本,加上 --vad True 可先做语音活动检测再识别。
whisper_timestamped --vad True ...8更换 VAD 方法
默认 VAD 为 silero,新版 silero 可能误报,可换成旧版 silero 或 auditok。
whisper_timestamped --vad silero:v3.1 ...
whisper_timestamped --vad auditok ...| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
vad | 否 | 转写前做语音活动检测,避免静音段产生幻觉文本 | True |
vad | 否 | 指定 VAD 实现版本,可选 silero 旧版或 auditok | silero:v3.1 |
plot | 否 | 命令行绘图展示 VAD 结果与词对齐情况 | True |
命令行运行 whisper_timestamped 能得到带词级时间戳的识别结果;加 --plot 可显示 VAD 与对齐图。
Q:没有 GPU 怎么办?
A:先按 README 的轻量安装命令装 CPU 版 torch 和 torchaudio,再安装 whisper-timestamped;也可用 Dockerfile.cpu 构建约 3.5GB 的 CPU 镜像。
Q:为什么还要单独装 ffmpeg?
A:README 明确把 ffmpeg 列为安装前提,音频读取与解码依赖它,安装方法见 OpenAI Whisper 仓库说明。
Q:识别结果出现静音段的假文本?
A:这是 Whisper 的幻觉现象,可开启 VAD(--vad True)把语音段拼接后再转写,或改用 silero:v3.1、auditok 等 VAD 方法。
Q:默认用哪种 VAD?
A:默认使用 silero;README 指出最新版 silero 在部分音频上误报较多,可换用旧版本或 auditok。
faster-whisper、whisperX、stable-ts
whisper-timestamped 是语音识别领域的开源项目,由 linto-ai 开发,2023 年首次发布。
在全站 13,559 个收录项目中,它的 GitHub 星标数(2,850)位列前 30%,在语音识别分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-28。开源免费,MIT许可证。
它主要面向的使用场景是:生成高精度字幕文件(SRT/VTT)。同类可对比的替代方案包括 faster-whisper、whisperX、stable-ts。
上一篇:WhisperLiveKit
下一篇:RealtimeSTT
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper