pocketsphinx

离线轻量语音识别,嵌入式设备也能实时听懂人话

PocketSphinx 是一个轻量级的嵌入式语音识别库,基于 CMU Sphinx 项目发展而来,专为资源受限环境设计。它解决在移动设备、嵌入式系统或离线场景下实现实时语音转文字的问题,无需依赖云端服务。核心能力包括:支持小词汇量和大词汇量的连续语音识别,提供声学模型和语言模型的训练与加载接口,具备麦克风实时识别和音频文件批处理功能。其 C 语言核心保证高性能和低内存占用,同时提供 Python 绑定,方便快速原型开发。项目包含完整的文档和示例,适合开发者集成到智能家居、机器人、车载系统等应用中。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4343
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类语音识别
开发团队cmusphinx
所属国家
官网地址
定价模式free
价格说明开源语音识别库,完全免费,需自行部署。
访问状态
是否开源是
开源协议NOASSERTION
主要语言C
技术栈/模型c,python,speech-recognition
GitHub 星标★ 4343
30天Star增速
HF 下载量
上线时间2014-04-07 00:00:00
最近更新2026-09-19 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数4

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 5 步

环境要求

  • CMake 构建工具(README 说明使用 CMake 构建,支持 Linux 和 Windows)
  • C 编译器(项目为 C 语言核心)
  • Debian/Ubuntu 系统可安装示例依赖:ffmpeg、libasound2-dev、libportaudio2、libportaudiocpp0
  • Python 绑定需 Python 环境(README 提及提供 Python 绑定)

安装与启动步骤

  1. 1安装系统依赖

    Debian/Ubuntu 及其衍生系统(如树莓派 OS)安装示例代码所需依赖,非构建必需但建议安装。

    sudo apt install 
        ffmpeg 
        libasound2-dev 
        libportaudio2 
        libportaudiocpp0
  2. 2获取源码

    从 GitHub 克隆 PocketSphinx 仓库到本地,README 未给出具体命令,此处为通用做法。

    git clone https://github.com/cmusphinx/pocketsphinx.git
  3. 3CMake 配置构建

    README 说明使用 CMake 构建,先在源码目录创建构建目录并运行 cmake 生成构建文件。

    cd pocketsphinx
    mkdir build
    cd build
    cmake ..
  4. 4编译项目

    运行 make 编译 C 核心库,README 未列出具体编译命令,此为 CMake 标准流程。

    make
  5. 5安装库

    将编译产物安装到系统目录,README 未明确给出安装命令,按 CMake 惯例执行。

    sudo make install

如何确认成功

README 未说明验证方式,可运行项目自带示例或检查识别功能是否正常。

常见问题

Q:还需要安装 SphinxBase 吗?

A:不需要。README 明确说明已不再依赖 SphinxBase,SphinxBase 已不存在。

Q:Windows 和 macOS 支持如何?

A:README 称 CMake 在 Linux 和 Windows 上表现合理,但未确认 macOS 支持情况。

Q:音频库需要单独安装吗?

A:不需要。旧版音频库已被移除,因其在各平台都无法正确构建或工作。

注意事项

  • README 未提供完整的构建与安装命令,上述步骤基于 CMake 常规流程推断,请以实际仓库为准。
  • 项目算法和模型较为古老(部分可追溯至 1970 年代),但胜在紧凑高效。
  • 版本号较大是因为曾有过 5prealpha 版本,今后将遵循语义版本规范。

核心亮点

  • 纯 C 实现,内存占用极低,适合树莓派等嵌入式设备
  • 支持实时麦克风输入和离线识别,无需联网保护隐私
  • 提供 Python API,快速集成到现有脚本和 AI 流程

不足之处

  • 识别准确率相比云端大模型(如 Whisper)有明显差距
  • 配置声学模型和语言模型门槛较高,需一定语音领域知识

适用场景

  • 智能家居离线语音控制(如开关灯、调节温度)
  • 机器人或车载系统的本地语音指令识别
  • 隐私敏感场景的语音转写(如医疗、会议记录)

替代项目

Vosk、Whisper.cpp、Kaldi

项目介绍

pocketsphinx 是语音识别领域的开源项目,由 cmusphinx 开发,2014 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(4,343)位列前 10%,在语音识别分类的 212 个项目里位列前 14%。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-19。开源语音识别库,完全免费,需自行部署。

它主要面向的使用场景是:智能家居离线语音控制(如开关灯、调节温度)。同类可对比的替代方案包括 Vosk、Whisper.cpp、Kaldi。

上一篇:porcupine

下一篇:whisper-asr-webservice

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13