WhisperTimeSync 是语音识别领域的开源项目,由 EtienneAb3d 开发,2023 年首次发布。
它收录于语音识别分类,该分类目前共有 212 个项目,GitHub 星标数为 167。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-24。本地部署,完全免费。
它主要面向的使用场景是:视频字幕制作,需要精确到帧级的时间轴。同类可对比的替代方案包括 faster-whisper、stable-ts、whisperx。

给 Whisper 字幕校准时间轴,让字幕精准同步
WhisperTimeSync 是一个用 Java 编写的开源工具,旨在解决 Whisper 语音识别结果中时间戳不准确的问题。它允许用户基于已有的、准确的转录文本,重新对齐 Whisper 生成的时间戳,从而提升字幕或文本与音频的同步精度。该工具核心能力是集成对齐器(aligner),利用 ASR 和 NLP 技术,将文本与音频进行精细对齐,最终输出更精确的字幕文件。它特别适用于对时间轴精度要求高的场景,如视频字幕制作、播客转写、会议记录等。通过简单的命令行或 API 调用,用户可以快速修正 Whisper 输出的时间偏移,无需重新运行整个识别流程,节省计算资源。项目处于早期阶段,但提供了一种实用的解决方案。
faster-whisper、stable-ts、whisperx
WhisperTimeSync 是语音识别领域的开源项目,由 EtienneAb3d 开发,2023 年首次发布。
它收录于语音识别分类,该分类目前共有 212 个项目,GitHub 星标数为 167。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-24。本地部署,完全免费。
它主要面向的使用场景是:视频字幕制作,需要精确到帧级的时间轴。同类可对比的替代方案包括 faster-whisper、stable-ts、whisperx。
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper