
esp-sr
让 ESP32 离线听懂人话,不联网也能语音控制
esp-sr 是乐鑫为 ESP32 系列芯片打造的离线语音识别与语音交互框架,用 C 语言编写,运行在资源受限的 MCU 上。它解决的是嵌入式设备无法依赖云端、又要实现本地语音唤醒与命令词识别的问题。核心能力包括唤醒词检测(如自定义“你好小智”)、离线命令词识别、语音活动检测、降噪与回声消除等前端处理,并支持中英文多语种模型。开发者可借助 ESP-IDF 将语音交互能力集成到智能家居、玩具、家电等产品中,无需联网即可响应,降低延迟与隐私风险。项目提供预训练模型、配置工具与示例工程,方便按需裁剪模型大小与内存占用,是 ESP32 生态中较成熟的语音方案。
项目预览
项目数据
Star 增长趋势
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
使用教程
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
环境要求
- 乐鑫 ESP32 系列开发板(官方文档覆盖 ESP32-S3、ESP32-P4 等芯片)
- 已安装可编译 C 工程的乐鑫 ESP-IDF 开发环境
- 具备 C 语言与嵌入式工程集成的基础经验
- 网络环境可访问 GitHub 与 docs.espressif.com 官方文档
安装与启动步骤
-
1准备开发环境
先装好乐鑫 ESP-IDF 工具链,确认能编译并烧录一个空的 ESP32 工程,再开始集成语音组件。
-
2获取 esp-sr 仓库
从官方仓库拉取 esp-sr 源码,README 说明这些算法以组件形式提供,可直接融入现有工程。
git clone https://github.com/espressif/esp-sr.git -
3了解五大功能模块
README 列出 AFE 音频前端、WakeNet 唤醒词、VADNet 语音活动检测、MultiNet 命令词、语音合成模块。
-
4查阅对应芯片文档
按开发板型号打开官方文档,如 ESP32-S3 或 ESP32-P4 目录下的对应模块说明,按其指引集成。
-
5集成进自己的工程
把 esp-sr 作为组件接入项目,按文档裁剪模型大小与内存占用,再编译烧录到设备上验证。
如何确认成功
README 未给出验证方式,请按官方文档中对应模块的说明,在设备上编译烧录后确认唤醒词与命令词能被识别。
常见问题
Q:esp-sr 包含哪些功能模块?
A:包含音频前端 AFE、唤醒词引擎 WakeNet、语音活动检测 VADNet、命令词识别 MultiNet 以及语音合成五大模块,均以组件形式提供。
Q:支持哪些芯片平台?
A:官方文档链接按平台划分,README 中可见 esp32s3 与 esp32p4 两条文档路径,其他型号请以最新官方文档为准。
Q:最新的唤醒词模型是哪个?
A:README 新闻显示已发布 WakeNet10 模型,目前提供 w16a16 和 w8a16(默认)两种由 esp-dl 实现的量化版本。
Q:需要联网才能识别语音吗?
A:不需要。esp-sr 是面向 ESP32 的离线语音框架,唤醒词与命令词识别均在设备本地完成,不依赖云端。
注意事项
- 本次 README 节选未提供任何安装命令、配置项与端口信息,因此以上步骤为基于项目描述的通用准备流程,具体操作请以官方文档为准。
- 文档地址为 https://docs.espressif.com/projects/esp-sr/en/latest/ ,集成前建议先确认与自己芯片型号匹配的章节。
- 模型有不同量化与体积版本,集成时需按目标芯片的内存与 Flash 资源做裁剪。
核心亮点
- 专为 ESP32 等 MCU 优化,可在低内存、低算力芯片上离线运行
- 提供唤醒词、命令词、降噪、回声消除等完整语音前端链路
- 与 ESP-IDF 深度集成,附带预训练模型和示例,上手门槛低
不足之处
- 模型与工具链绑定乐鑫芯片,跨平台移植困难
- 中文文档和社区讨论相对有限,高级定制依赖官方支持
适用场景
- 智能音箱/语音助手:本地唤醒并执行开关灯等命令
- 智能家电:离线语音控制空调、风扇等设备
- 玩具与教育硬件:低成本实现语音互动,无需联网
替代项目
Porcupine、snowboy
项目介绍
同类项目推荐
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper