
NeMo-Speech.cpp
用 C++ 跑 NeMo 语音模型,免 Python 低资源做识别与合成
NeMo-Speech.cpp 是一个基于 ggml 的轻量级 C++ 推理运行时,专门用于运行 NVIDIA NeMo 系列语音模型,覆盖语音识别(ASR)与文本转语音(TTS)两大任务。它解决的核心问题是:NeMo 官方工具链依赖 Python 与 PyTorch,部署体积大、启动慢,难以嵌入到桌面端、移动端或边缘设备中。该项目把模型推理用纯 C++ 重写,借助 ggml 的量化与 CPU/GPU 后端能力,让语音模型可以在无 Python 环境、低内存占用的条件下运行,并提供 server 模式方便以 HTTP 接口方式对外提供识别与合成服务。核心能力包括:加载量化后的 NeMo 模型权重、执行流式或离线语音识别、文本转语音合成,以及通过内置服务端做批量或在线推理。整体定位类似 whisper.cpp 之于 Whisper,是 NeMo 语音模型在 C++ 侧的轻量落地方案。
项目数据
使用教程
核心亮点
- 纯 C++ + ggml 实现,无需 Python/PyTorch 运行时,便于嵌入桌面与边缘设备
- 同时覆盖 ASR 与 TTS 两类语音任务,一个运行时解决识别和合成
- 内置 server 模式,可直接以 HTTP 服务方式对外提供语音推理能力
不足之处
- 项目处于早期,星标仅 104,模型覆盖范围与算子支持仍在完善中
- 文档与预转换模型资源有限,上手需要自行处理 NeMo 权重转换
适用场景
- 在无 Python 环境的边缘设备或嵌入式板卡上部署离线语音识别
- 为桌面应用集成轻量文本转语音,避免打包庞大的 PyTorch 依赖
- 自建语音识别/合成 HTTP 服务,供内部系统或产品调用
替代项目
whisper.cpp、sherpa-onnx、kaldi
项目介绍
上一篇:stt-server
下一篇:docker-whisper
同类项目推荐
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper