esp32-ai 是行业应用领域的开源项目,由 slvDev 开发,是 2026 年新上线的项目。
在全站 13,559 个收录项目中,它的 GitHub 星标数(4,441)位列前 10%,在行业应用分类的 580 个项目里位列前 7%。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-10-01。免费使用。
它主要面向的使用场景是:离线语音唤醒词识别智能家居设备。同类可对比的替代方案包括 TensorFlow Lite Micro、Edge Impulse。

让 ESP32 跑 AI,离线语音识别不联网
esp32-ai 是一个面向 ESP32 系列微控制器的开源 AI 推理框架,目标是在资源极度受限的嵌入式设备上直接运行神经网络模型,而无需依赖云端或高性能边缘服务器。它解决了传统 AI 部署必须联网、延迟高、隐私差的问题,让语音唤醒、关键词识别、简单图像分类等任务能在本地低功耗芯片上完成。核心能力包括:支持 TensorFlow Lite Micro 等轻量模型转换与量化,提供 C/C++ 与 Python 混合开发接口,内置内存优化与算子裁剪,适配 ESP32、ESP32-S3 等常见模组。项目以 Python 为主要语言,便于快速原型验证,同时保留底层性能。凭借 4400+ 星标,它已成为嵌入式 AI 领域较受关注的选择,适合创客、IoT 开发者与边缘计算研究者快速验证端侧智能想法。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
1确认硬件配置
必须是 ESP32-S3,且具备 512KB SRAM、8MB PSRAM、16MB flash;普通 ESP32 无法满足。
2准备量化模型
模型共 28.9M 参数,4-bit 量化后为 14.9MB,其中约 25M 参数放在 flash 查表中。
3连接显示屏幕
按硬件接线把小块屏幕接到芯片上,用于显示模型生成的文本。
4编译并烧录固件
README 节选未给出具体命令,请以仓库中 Run it yourself 章节的当前说明为准。
5上电离线推理
设备不需要任何网络连接,上电后即在芯片本地生成文本并输出到屏幕。
屏幕上出现生成的文本,端到端约 9.88 tokens/s,且设备全程未联网。
Q:运行这个模型需要联网吗?
A:不需要。README 明确说明所有计算都在设备本地完成,不向服务器发送任何数据,Connectivity 一栏为 none。
Q:普通 ESP32 能跑吗?
A:不行。项目目标是 ESP32-S3,配置要求 512KB SRAM、8MB PSRAM 和 16MB flash,内存不足的模组无法加载模型。
Q:模型有多大、速度多快?
A:28.9M 参数,4-bit 量化后约 14.9MB;端到端 9.88 tokens/s,平均每 token 约 94.9ms 计算时间。
Q:代码项目是什么语言?
A:仓库主要语言为 Python,便于快速原型验证,同时面向 ESP32 做底层性能优化。
TensorFlow Lite Micro、Edge Impulse
esp32-ai 是行业应用领域的开源项目,由 slvDev 开发,是 2026 年新上线的项目。
在全站 13,559 个收录项目中,它的 GitHub 星标数(4,441)位列前 10%,在行业应用分类的 580 个项目里位列前 7%。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-10-01。免费使用。
它主要面向的使用场景是:离线语音唤醒词识别智能家居设备。同类可对比的替代方案包括 TensorFlow Lite Micro、Edge Impulse。
上一篇:SakikoMind
下一篇:没有了!
xmgai-like
开源
换脸、艺术二维码随手玩,副业灵感一包带走。
本开源 AI 副业搞钱项目集成了强大功能,包括 AI 艺术二维码生成、AI 换脸、Delle3 绘画等···
spoken-to-signed-translation
开源
把口语文本一路转成手语视频的流水线
a text-to-gloss-to-pose-to-video pipeline for spoken to signed language translation
DDC_Skills_for_AI_Agents_in_Cons···
开源
给建筑AI装上221个专业技能,让Claude秒变工地专家
221 AI skills for construction: BIM analysis, cost estimation, scheduling, document ···
LiveTranslate
开源
直播看片实时翻译,字幕秒出,跨语言无压力
Real-time audio translation, captures system audio + mic, runs ASR (Whisper/SenseVoi···