NeMo-Speech.cpp

用 C++ 跑 NeMo 语音模型,免 Python 低资源做识别与合成

NeMo-Speech.cpp 是一个基于 ggml 的轻量级 C++ 推理运行时,专门用于运行 NVIDIA NeMo 系列语音模型,覆盖语音识别(ASR)与文本转语音(TTS)两大任务。它解决的核心问题是:NeMo 官方工具链依赖 Python 与 PyTorch,部署体积大、启动慢,难以嵌入到桌面端、移动端或边缘设备中。该项目把模型推理用纯 C++ 重写,借助 ggml 的量化与 CPU/GPU 后端能力,让语音模型可以在无 Python 环境、低内存占用的条件下运行,并提供 server 模式方便以 HTTP 接口方式对外提供识别与合成服务。核心能力包括:加载量化后的 NeMo 模型权重、执行流式或离线语音识别、文本转语音合成,以及通过内置服务端做批量或在线推理。整体定位类似 whisper.cpp 之于 Whisper,是 NeMo 语音模型在 C++ 侧的轻量落地方案。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 111
维护状态 活跃
是否开源
定价模式 free

项目数据

分类语音识别
开发团队NVIDIA
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源
开源协议Apache-2.0
主要语言C++
技术栈/模型ggml,inference,server,speech-recognition,text-to-speech
GitHub 星标★ 111
30天Star增速
HF 下载量
上线时间2026-07-15 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

核心亮点

  • 纯 C++ + ggml 实现,无需 Python/PyTorch 运行时,便于嵌入桌面与边缘设备
  • 同时覆盖 ASR 与 TTS 两类语音任务,一个运行时解决识别和合成
  • 内置 server 模式,可直接以 HTTP 服务方式对外提供语音推理能力

不足之处

  • 项目处于早期,星标仅 104,模型覆盖范围与算子支持仍在完善中
  • 文档与预转换模型资源有限,上手需要自行处理 NeMo 权重转换

适用场景

  • 在无 Python 环境的边缘设备或嵌入式板卡上部署离线语音识别
  • 为桌面应用集成轻量文本转语音,避免打包庞大的 PyTorch 依赖
  • 自建语音识别/合成 HTTP 服务,供内部系统或产品调用

替代项目

whisper.cpp、sherpa-onnx、kaldi

项目介绍

NeMo-Speech.cpp 是一个语音识别领域的开源项目,官方简介:NeMo-Speech.cpp is a lightweight C++ inference runtime for Speech models。项目使用 C++ 开发,在 GitHub 上获得 104 星标。

上一篇:stt-server

下一篇:docker-whisper

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1613 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3713 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11823 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5649 2026-08-13