google-speech-v2 是语音识别领域的开源项目,由 gillesdemey 开发,2014 年首次发布。
它收录于语音识别分类,该分类目前共有 192 个项目,GitHub 星标数为 469。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-04-08。本地部署使用,完全免费。
它主要面向的使用场景是:个人开发者快速搭建语音转文字原型工具。同类可对比的替代方案包括 Whisper (OpenAI)、Vosk、Kaldi。

逆向 Google 语音接口,免费实现语音转文字
google-speech-v2 是一个针对 Google 语音转文字 API(v2 版本)的逆向工程项目。它通过分析 Google 内部接口的请求协议,提供了一套非官方的调用方式,使开发者无需使用官方付费 SDK 即可实现语音识别。项目主要解决早期开发者无法便捷访问高质量语音识别能力的问题,核心能力包括捕获音频流、构造 HTTP 请求、解析识别结果等。它提供了简单的 API 封装,支持多种音频格式输入,并返回文本转录。该项目适合研究语音识别接口原理、构建轻量级语音应用或作为学习逆向工程的案例。由于是早期项目,其接口可能随 Google 服务更新而失效,但代码结构清晰,对理解语音识别通信机制有参考价值。
Whisper (OpenAI)、Vosk、Kaldi
google-speech-v2 是语音识别领域的开源项目,由 gillesdemey 开发,2014 年首次发布。
它收录于语音识别分类,该分类目前共有 192 个项目,GitHub 星标数为 469。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-04-08。本地部署使用,完全免费。
它主要面向的使用场景是:个人开发者快速搭建语音转文字原型工具。同类可对比的替代方案包括 Whisper (OpenAI)、Vosk、Kaldi。
上一篇:whisper_android
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper