esp-sr

让 ESP32 离线听懂人话,不联网也能语音控制

esp-sr 是乐鑫为 ESP32 系列芯片打造的离线语音识别与语音交互框架,用 C 语言编写,运行在资源受限的 MCU 上。它解决的是嵌入式设备无法依赖云端、又要实现本地语音唤醒与命令词识别的问题。核心能力包括唤醒词检测(如自定义“你好小智”)、离线命令词识别、语音活动检测、降噪与回声消除等前端处理,并支持中英文多语种模型。开发者可借助 ESP-IDF 将语音交互能力集成到智能家居、玩具、家电等产品中,无需联网即可响应,降低延迟与隐私风险。项目提供预训练模型、配置工具与示例工程,方便按需裁剪模型大小与内存占用,是 ESP32 生态中较成熟的语音方案。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1522
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类语音识别
开发团队espressif
所属国家
官网地址
定价模式free
价格说明开源免费,Apache-2.0 许可证
访问状态
是否开源是
开源协议NOASSERTION
主要语言C
技术栈/模型
GitHub 星标★ 1522
30天Star增速
HF 下载量
上线时间2019-07-29 00:00:00
最近更新2026-09-30 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-01
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

使用教程

难度:进阶 约 30 分钟 部署方式:库/依赖 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 乐鑫 ESP32 系列开发板(官方文档覆盖 ESP32-S3、ESP32-P4 等芯片)
  • 已安装可编译 C 工程的乐鑫 ESP-IDF 开发环境
  • 具备 C 语言与嵌入式工程集成的基础经验
  • 网络环境可访问 GitHub 与 docs.espressif.com 官方文档

安装与启动步骤

  1. 1准备开发环境

    先装好乐鑫 ESP-IDF 工具链,确认能编译并烧录一个空的 ESP32 工程,再开始集成语音组件。

  2. 2获取 esp-sr 仓库

    从官方仓库拉取 esp-sr 源码,README 说明这些算法以组件形式提供,可直接融入现有工程。

    git clone https://github.com/espressif/esp-sr.git
  3. 3了解五大功能模块

    README 列出 AFE 音频前端、WakeNet 唤醒词、VADNet 语音活动检测、MultiNet 命令词、语音合成模块。

  4. 4查阅对应芯片文档

    按开发板型号打开官方文档,如 ESP32-S3 或 ESP32-P4 目录下的对应模块说明,按其指引集成。

  5. 5集成进自己的工程

    把 esp-sr 作为组件接入项目,按文档裁剪模型大小与内存占用,再编译烧录到设备上验证。

如何确认成功

README 未给出验证方式,请按官方文档中对应模块的说明,在设备上编译烧录后确认唤醒词与命令词能被识别。

常见问题

Q:esp-sr 包含哪些功能模块?

A:包含音频前端 AFE、唤醒词引擎 WakeNet、语音活动检测 VADNet、命令词识别 MultiNet 以及语音合成五大模块,均以组件形式提供。

Q:支持哪些芯片平台?

A:官方文档链接按平台划分,README 中可见 esp32s3 与 esp32p4 两条文档路径,其他型号请以最新官方文档为准。

Q:最新的唤醒词模型是哪个?

A:README 新闻显示已发布 WakeNet10 模型,目前提供 w16a16 和 w8a16(默认)两种由 esp-dl 实现的量化版本。

Q:需要联网才能识别语音吗?

A:不需要。esp-sr 是面向 ESP32 的离线语音框架,唤醒词与命令词识别均在设备本地完成,不依赖云端。

注意事项

  • 本次 README 节选未提供任何安装命令、配置项与端口信息,因此以上步骤为基于项目描述的通用准备流程,具体操作请以官方文档为准。
  • 文档地址为 https://docs.espressif.com/projects/esp-sr/en/latest/ ,集成前建议先确认与自己芯片型号匹配的章节。
  • 模型有不同量化与体积版本,集成时需按目标芯片的内存与 Flash 资源做裁剪。

核心亮点

  • 专为 ESP32 等 MCU 优化,可在低内存、低算力芯片上离线运行
  • 提供唤醒词、命令词、降噪、回声消除等完整语音前端链路
  • 与 ESP-IDF 深度集成,附带预训练模型和示例,上手门槛低

不足之处

  • 模型与工具链绑定乐鑫芯片,跨平台移植困难
  • 中文文档和社区讨论相对有限,高级定制依赖官方支持

适用场景

  • 智能音箱/语音助手:本地唤醒并执行开关灯等命令
  • 智能家电:离线语音控制空调、风扇等设备
  • 玩具与教育硬件:低成本实现语音互动,无需联网

替代项目

Porcupine、snowboy

项目介绍

esp-sr 是一个语音识别领域的开源项目,官方简介:Speech recognition。项目使用 C 开发,在 GitHub 上获得 1522 星标。

上一篇:speech_to_text

下一篇:expo-speech-recognition

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1619 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3786 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11848 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5659 2026-08-13