Speech

一站式语音生成框架,快速构建 ASR/TTS 应用

Speech 是一个面向研究人员和开发者的可扩展生成式 AI 框架,专注于大型语言模型、多模态和语音 AI(自动语音识别与文本转语音)。它提供统一的模块化架构,支持 ASR、TTS、说话人识别、说话人分离、机器翻译等任务,内置多种预训练模型和训练流水线,简化了从数据预处理到模型部署的流程。核心能力包括高灵活性的模型配置、分布式训练支持、以及丰富的语音处理工具链,旨在降低语音 AI 开发门槛,加速科研与产品落地。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 18490
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队NVIDIA-NeMo
所属国家
定价模式free
价格说明开源框架,Apache-2.0许可,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型asr,deeplearning,generative-ai,machine-translation,neural-networks,speaker-diariazation,speaker-recognition,speech-synthesis,speech-translation,tts
GitHub 星标★ 18490
30天Star增速
HF 下载量
上线时间2019-08-05 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:进阶 约 20 分钟 部署方式:Docker 6 步

环境要求

  • 已安装 Docker,并能访问 nvcr.io 镜像仓库
  • 宿主机具备 NVIDIA GPU,且已配置 NVIDIA Container Toolkit(命令中使用了 --gpus all)
  • 足够的磁盘空间用于存放 NGC 容器镜像(含 CUDA/PyTorch)
  • 从源码构建镜像时需支持 buildx 的 Docker(默认 CUDA 13 / H100+)

安装与启动步骤

  1. 1拉取官方镜像

    拉取 26.07.00 版 NGC 容器,这是官方提供的最新开箱即用镜像,体积较大请耐心等待。

    docker pull nvcr.io/nvidia/nemo-speech:26.07.00
  2. 2启动官方容器

    以 GPU 模式交互启动镜像,并把当前目录挂载到容器内 /workspace 便于读写数据,退出后容器自动删除。

    docker run --rm -it --gpus all -v "$PWD:/workspace" nvcr.io/nvidia/nemo-speech:26.07.00 bash
  3. 3克隆源码仓库

    若想自行构建镜像或从源码安装,先把仓库克隆到本地并进入目录。

    git clone https://github.com/NVIDIA-NeMo/Speech.git
    cd Speech
  4. 4从源码构建镜像

    使用仓库内 docker/Dockerfile 构建本地镜像 nemo-speech,默认基础镜像是 CUDA 13 / H100+。

    docker buildx build -f docker/Dockerfile -t nemo-speech .
  5. 5A100 专用构建

    使用 A100 显卡时通过构建参数指定 GPU_TARGET=a100,A100 同时兼容 CUDA 12 与 CUDA 13。

    docker buildx build -f docker/Dockerfile --build-arg GPU_TARGET=a100 -t nemo-speech .
  6. 6运行自建镜像

    用刚构建的本地镜像启动容器,挂载工作目录后即可在容器内使用 NeMo Speech。

    docker run --rm -it --gpus all -v "$PWD:/workspace" nemo-speech bash

关键配置

配置项必填说明示例
GPU_TARGET否构建镜像时指定目标 GPU 架构,A100 需设为 a100,未指定时为 CUDA 13/H100+a100
BASE_IMAGE否构建时替换的基础镜像参数,具体取值见 docker/Dockerfile 头部说明见 docker/Dockerfile 头部

如何确认成功

命令执行后无报错并进入容器内的 bash 提示符,即表示镜像拉取/构建成功且环境可用。

常见问题

Q:推荐的安装方式是哪种?

A:README 推荐用 uv 从源码安装,以复现 uv.lock 中实际测试过的依赖栈;若需要不同的 Python/PyTorch/CUDA 版本,也可用 pip 装到现有环境(见 README 的 pip fallback 章节)。

Q:A100 显卡怎么构建镜像?

A:在 buildx 命令中加入 --build-arg GPU_TARGET=a100;A100 同时兼容 CUDA 12 和 CUDA 13,默认的 CUDA 13 基础镜像被推荐使用。

Q:不同版本的镜像对应关系是什么?

A:NeMo Speech 3.0 对应 26.07.00 NGC 容器;仓库拆分前的最后一个 NeMo 版本 v2.7.3 对应 26.04 NeMo 容器。

注意事项

  • 官方最新预构建镜像是 nvcr.io/nvidia/nemo-speech:26.07.00,对应 NeMo Speech 3.0。
  • docker/Dockerfile 头部列出了全部构建参数(如 BASE_IMAGE、GPU_TARGET),自定义构建前请先查看。
  • 使用 --gpus all 要求宿主机已正确配置 NVIDIA Container Toolkit,否则容器无法调用 GPU。
  • -v "$PWD:/workspace" 会把当前目录挂载进容器,容器退出后文件仍保留在宿主机;--rm 则会在退出后删除容器。

核心亮点

  • 模块化设计,支持 ASR、TTS、说话人识别等多种任务自由组合
  • 内置多种预训练模型和数据集加载器,开箱即用
  • 基于 PyTorch Lightning,支持分布式训练和混合精度,扩展性强

不足之处

  • 文档偏学术,新手入门曲线较陡
  • 部分高级功能依赖特定硬件或外部服务,部署稍复杂

适用场景

  • 学术研究:快速复现语音识别/合成论文实验
  • 产品开发:构建多语言语音助手或字幕生成工具
  • 多模态应用:结合 LLM 实现语音交互的智能体

替代项目

ESPnet、NeMo、Coqui TTS

项目介绍

Speech 是开发框架领域的开源项目,由 NVIDIA-NeMo 开发,2019 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(18,490)位列前 3%,在开发框架分类的 803 个项目里位列前 3%。

近 41 天,它的 GitHub 星标从 18,112 增加到 18,490,净增 378。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0许可,完全免费,可自行部署使用。

它主要面向的使用场景是:学术研究:快速复现语音识别/合成论文实验。同类可对比的替代方案包括 ESPnet、NeMo、Coqui TTS。

上一篇:neurolink

下一篇:ai-devices

同类项目推荐

langchain 开源

组装 AI 应用的乐高积木,从想法到上线不换工具

The agent engineering platform.

★ 146874 2026-08-09
transformers 开源

全球最大的模型仓库全家桶,想用的模型一把抓

Transformers: the model-definition framework for state-of-the-art machine learning m···

★ 166529 2026-08-09
pi 开源

一套 TypeScript 工具包,快速搭出能写代码的 AI agent

AI agent toolkit: unified LLM API, agent loop, TUI, coding agent CLI

★ 108504 2026-09-12