vosk-api

离线语音识别,不用联网,隐私安全,本地秒转文字

vosk-api 是一个离线语音识别 API,支持 Android、iOS、Raspberry Pi 和服务器端,提供 Python、Java、C# 和 Node 等多种语言绑定。它基于 Kaldi 技术,解决了实时语音识别需要联网、依赖云服务的问题,让开发者可以在本地设备上实现低延迟、高隐私的语音转文字。核心能力包括流式识别、大词汇量支持、多语言模型(如中文、英文等),以及轻量级模型适配嵌入式设备。它特别适合网络不稳定或对数据隐私要求高的场景,如智能家居、车载系统、移动应用等。通过简单的 API 调用,开发者可以快速集成,无需深厚的机器学习背景。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 15140
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类语音识别
开发团队alphacep
所属国家
官网地址
定价模式free
价格说明开源项目,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Jupyter Notebook
技术栈/模型android,asr,deep-learning,deep-neural-networks,deepspeech,google-speech-to-text,ios,kaldi,offline,privacy,python,raspberry-pi,speaker-identification,speaker-verification,speech-recognition,speech-to-text,speech-to-text-android,stt,voice-recognition,vosk
GitHub 星标★ 15140
30天Star增速
HF 下载量
上线时间2019-09-03 00:00:00
最近更新2026-09-22 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数5

使用教程

难度:入门 约 20 分钟 部署方式:库/依赖 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 准备目标语言的运行时环境(Python / Java / Node.JS / C# / C++ / Rust / Go 任选其一)
  • 需要能访问 Vosk 官网 alphacephei.com/vosk 获取安装说明与示例
  • 需要下载对应语言的语音模型(约 50Mb)
  • 可选:Raspberry Pi、Android、iOS 等设备也可运行

安装与启动步骤

  1. 1阅读官方文档

    README 未提供安装命令,明确指出安装说明、示例与文档请访问 Vosk 官网 alphacephei.com/vosk,先按官网指引操作。

  2. 2选择语言绑定

    Vosk 提供 Python、Java、Node.JS、C#、C++、Rust、Go 等多种绑定,按你的项目语言选择对应实现。

  3. 3准备运行环境

    按所选语言准备好对应的运行时或开发环境,再依照官网该语言章节完成安装。

  4. 4下载语音模型

    在官网挑选所需语言的模型下载,模型体积约 50Mb,支持连续大词汇量转写,可按设备性能取舍。

  5. 5调用流式 API

    按官网示例调用流式识别接口,它支持零延迟响应与可重配置词表,也可用于说话人识别。

如何确认成功

README 未给出具体验证命令;按官网示例运行一次流式识别,能实时返回转录文本即视为可用。

常见问题

Q:使用 Vosk 需要联网吗?

A:不需要。Vosk 是离线开源语音识别工具包,识别在本地设备完成,适合网络不稳定或对数据隐私要求高的场景。

Q:是否支持中文?

A:支持。README 列出中文在内 20 多种语言和方言,另有英语、德语、法语、西班牙语、俄语、日语等。

Q:模型有多大,能在小设备上跑吗?

A:官方描述模型约 50Mb,同时提供大词汇量连续转写,可从树莓派、安卓手机一直扩展到大型集群。

Q:支持哪些编程语言?

A:已实现 Python、Java、Node.JS、C#、C++、Rust、Go 等绑定,可按项目技术栈选择。

Q:为什么没有给出具体安装命令?

A:README 只指向 Vosk 官网获取安装说明,为避免误导,本教程未给出未经官方文档确认的命令。

注意事项

  • README 未包含任何安装命令,实际安装步骤请以 Vosk 官网 alphacephei.com/vosk 为准。
  • 本教程步骤仅依据 README 可确认的信息整理,未虚构包名、端口或路径。
  • 使用前需按目标语言下载对应模型,模型约 50Mb。
  • 典型应用场景包括聊天机器人、智能家居、虚拟助手、影视字幕与讲座访谈转写。

核心亮点

  • 完全离线运行,数据不出设备,隐私保护强
  • 支持多语言和多种编程语言绑定,集成灵活
  • 基于 Kaldi 的先进模型,识别准确率高,支持流式识别

不足之处

  • 模型文件较大,对存储和内存有一定要求
  • 文档和社区支持相对有限,新手入门有门槛

适用场景

  • 移动应用语音输入(Android/iOS)
  • 嵌入式设备(如树莓派)的语音控制
  • 服务器端批量音频转写,无需云服务

替代项目

Mozilla DeepSpeech、Whisper (OpenAI)、PaddleSpeech

项目介绍

vosk-api 是语音识别领域的开源项目,由 alphacep 开发,2019 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(15,140)位列前 4%,在语音识别分类的 212 个项目里位列前 4%。

近 41 天,它的 GitHub 星标从 15,049 增加到 15,140,净增 91。

项目仍在小幅维护中,最近一次代码更新于 2026-09-22。完全免费,可自行部署使用。

它主要面向的使用场景是:移动应用语音输入(Android/iOS)。同类可对比的替代方案包括 Mozilla DeepSpeech、Whisper (OpenAI)、PaddleSpeech。

上一篇:FunASR

下一篇:SenseVoice

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13