whisper_dictation 是语音识别领域的开源项目,由 themanyone 开发,2023 年首次发布。
它收录于语音识别分类,该分类目前共有 212 个项目,GitHub 星标数为 294。
项目仍在小幅维护中,最近一次代码更新于 2026-09-17。GPL-2.0许可,本地部署,完全免费。
它主要面向的使用场景是:无障碍场景:肢体不便用户通过语音操作电脑和AI。同类可对比的替代方案包括 Whisper.cpp、faster-whisper、VoiceInk。

用语音控制电脑和 AI,免打字,隐私本地化。
whisper_dictation 是一个开源的私人语音键盘和 AI 助手,旨在通过语音控制实现免提操作。它利用 Whisper 模型进行本地语音识别,支持语音输入、AI 对话、图像生成、网页搜索、摄像头调用和录音等功能,且仅需 4GB 显存即可运行。项目采用客户端-服务器架构,提供连续听写和语音命令控制,适合无障碍场景和高效办公。核心能力包括本地隐私保护、多模态交互(文本、图像、语音)以及自定义 AI 代理,解决用户对隐私敏感和低延迟语音交互的需求。
Whisper.cpp、faster-whisper、VoiceInk
whisper_dictation 是语音识别领域的开源项目,由 themanyone 开发,2023 年首次发布。
它收录于语音识别分类,该分类目前共有 212 个项目,GitHub 星标数为 294。
项目仍在小幅维护中,最近一次代码更新于 2026-09-17。GPL-2.0许可,本地部署,完全免费。
它主要面向的使用场景是:无障碍场景:肢体不便用户通过语音操作电脑和AI。同类可对比的替代方案包括 Whisper.cpp、faster-whisper、VoiceInk。
上一篇:talon-ai-tools
下一篇:ComfyUI-Whisper
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper