kaldi-active-grammar 是语音识别领域的开源项目,由 daanzu 开发,2019 年首次发布。
它收录于语音识别分类,该分类目前共有 165 个项目,GitHub 星标数为 350。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-07。开源免费,需自行部署。
它主要面向的使用场景是:桌面语音助手:平时听写,说唤醒词后切换成精确命令模式。同类可对比的替代方案包括 Vosk、Kaldi、Mozilla DeepSpeech。

解码中随时切换语法,让语音命令和听写自由混用
kaldi-active-grammar 是一个基于 Kaldi 的 Python 语音识别封装,核心创新在于支持在解码过程中动态激活或停用语法规则。传统语音识别要么做通用听写,要么把命令词写死,用户很难在运行时切换识别范围。该项目通过把语法编译成 Kaldi 的 FST 并暴露 Python 接口,让开发者可以在解码中途改变哪些词、短语或命令处于可识别状态,从而同时兼顾自由听写和精确命令控制。它适合做语音助手、桌面控制、游戏指令等需要低延迟、高准确率且能随上下文切换识别目标的场景。项目提供 Python API,可加载自定义语法文件,也支持与麦克风实时交互,是 Kaldi 生态里少见的把动态语法能力做得比较完整的工具。
Vosk、Kaldi、Mozilla DeepSpeech
kaldi-active-grammar 是语音识别领域的开源项目,由 daanzu 开发,2019 年首次发布。
它收录于语音识别分类,该分类目前共有 165 个项目,GitHub 星标数为 350。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-07。开源免费,需自行部署。
它主要面向的使用场景是:桌面语音助手:平时听写,说唤醒词后切换成精确命令模式。同类可对比的替代方案包括 Vosk、Kaldi、Mozilla DeepSpeech。
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper