WhisperTimeSync

给 Whisper 字幕校准时间轴,让字幕精准同步

WhisperTimeSync 是一个用 Java 编写的开源工具,旨在解决 Whisper 语音识别结果中时间戳不准确的问题。它允许用户基于已有的、准确的转录文本,重新对齐 Whisper 生成的时间戳,从而提升字幕或文本与音频的同步精度。该工具核心能力是集成对齐器(aligner),利用 ASR 和 NLP 技术,将文本与音频进行精细对齐,最终输出更精确的字幕文件。它特别适用于对时间轴精度要求高的场景,如视频字幕制作、播客转写、会议记录等。通过简单的命令行或 API 调用,用户可以快速修正 Whisper 输出的时间偏移,无需重新运行整个识别流程,节省计算资源。项目处于早期阶段,但提供了一种实用的解决方案。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 167
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队EtienneAb3d
所属国家
官网地址
定价模式free
价格说明开源项目,本地部署,完全免费。
访问状态
是否开源是
开源协议
主要语言Java
技术栈/模型aligner,asr,nlp,subtitles,text-to-speech,whisper
GitHub 星标★ 167
30天Star增速
HF 下载量
上线时间2023-02-09 00:00:00
最近更新2026-08-24 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 无需重新运行 Whisper,基于现有转录文本即可修正时间戳,节省算力
  • 专注于时间对齐,解决 Whisper 在长音频或噪声环境下时间偏移的痛点
  • Java 实现,易于集成到现有 Java 多媒体处理流程中

不足之处

  • 项目处于早期阶段,API 和功能可能不稳定
  • 文档/社区待观察

适用场景

  • 视频字幕制作,需要精确到帧级的时间轴
  • 播客或会议录音转写后,修正时间戳以匹配音频
  • 对 Whisper 输出进行后处理,提升下游 NLP 任务的时序准确性

替代项目

faster-whisper、stable-ts、whisperx

项目介绍

WhisperTimeSync 是语音识别领域的开源项目,由 EtienneAb3d 开发,2023 年首次发布。

它收录于语音识别分类,该分类目前共有 212 个项目,GitHub 星标数为 167。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-24。本地部署,完全免费。

它主要面向的使用场景是:视频字幕制作,需要精确到帧级的时间轴。同类可对比的替代方案包括 faster-whisper、stable-ts、whisperx。

上一篇:OSSSpeechKit

下一篇:bournemouth-forced-aligner

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13