speechbrain

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 11861
维护状态 维护中
是否开源 是
定价模式 free

项目预览

项目数据

分类语音识别
开发团队speechbrain
所属国家
定价模式free
价格说明开源免费,Apache 2.0许可证
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型asr,audio,audio-processing,deep-learning,huggingface,language-model,pytorch,speaker-diarization,speaker-recognition,speaker-verification,speech-enhancement,speech-processing,speech-recognition,speech-separation,speech-to-text,speech-toolkit,speechrecognition,spoken-language-understanding,transformers,voice-recognition
GitHub 星标★ 11861
30天Star增速
HF 下载量
上线时间2020-04-28 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-26
浏览次数13

项目介绍

SpeechBrain 是一个基于 PyTorch 的开源语音工具包,旨在为语音识别、说话人识别、语音增强、语音分离、情感识别等多种语音任务提供统一、灵活且易用的解决方案。它解决了语音领域研究者和开发者面临的环境碎片化、模型复现困难、训练流程复杂等问题,通过模块化设计和丰富的预训练模型,降低了语音 AI 的开发门槛。核心能力包括:支持端到端语音识别(ASR)、说话人验证与识别(Speaker ID)、语音活动检测(VAD)、语音增强与分离、以及多语言语音处理;提供大量预训练模型和 HuggingFace 集成,支持快速微调和推理;内置多种训练配方(recipes),可复现主流论文结果;基于 PyTorch,支持动态图、分布式训练和混合精度,方便自定义扩展。

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:入门 约 15 分钟 部署方式:库/依赖 7 步

环境要求

  • Python 环境(README 未指定具体版本)
  • 已安装 PyTorch(SpeechBrain 是 PyTorch 工具包)
  • pip 可正常联网安装包
  • 从 GitHub 安装时需已安装 git

安装与启动步骤

  1. 1PyPI 安装

    最简安装方式,适合只想直接调用 SpeechBrain 功能的用户,一条命令即可完成。

    pip install speechbrain
  2. 2验证导入

    在 Python 中导入 speechbrain,不报错说明包已装好。

    import speechbrain as sb
  3. 3克隆仓库

    如需做实验或二次开发,先从 GitHub 拉取源码到本地。

    git clone https://github.com/speechbrain/speechbrain.git
    cd speechbrain
  4. 4安装依赖

    安装仓库根目录 requirements.txt 中列出的全部依赖包。

    pip install -r requirements.txt
  5. 5可编辑安装

    以 --editable 方式安装,之后对包的修改会自动生效。

    pip install --editable .
  6. 6测试安装

    跑仓库自带测试,确认安装无误。

    pytest tests
    pytest --doctest-modules speechbrain
  7. 7运行训练实验

    进入具体任务的 recipe 目录,指定 YAML 参数文件启动训练,结果存入 output_folder。

    cd recipes///
    python experiment.py params.yaml

关键配置

配置项必填说明示例
output_folder是YAML 参数文件中指定,训练结果会保存到该目录output_folder

如何确认成功

运行 pytest tests 与 pytest --doctest-modules speechbrain,或在 Python 中 import speechbrain as sb 无报错。

常见问题

Q:PyPI 安装和 GitHub 安装该选哪个?

A:只想调用功能、做推理用 pip install speechbrain;需要做实验或定制 toolkit,则从 GitHub 克隆并 pip install --editable .

Q:--editable 安装有什么好处?

A:README 说明该标志可让对 speechbrain 包的任何修改自动生效,方便边改边用。

Q:训练结果保存在哪里?

A:保存在参数 YAML 文件里指定的 output_folder 目录中。

Q:怎么跑某个任务的训练?

A:进入 recipes/// 目录,执行 python experiment.py params.yaml。

注意事项

  • README 未给出支持的 Python 版本,建议先确认本地 Python 与 PyTorch 兼容
  • recipes 路径需按实际数据集与任务替换,不能照抄占位符
  • 从 GitHub 安装前需先 cd 进克隆下来的 speechbrain 目录
  • 推理与微调可参考官网及 HuggingFace 上的预训练模型页面

核心亮点

  • 模块化设计,各组件(特征、模型、解码器)可自由组合,便于研究和定制
  • 内置大量预训练模型和 HuggingFace 集成,开箱即用,推理部署方便
  • 提供丰富的训练配方(recipes),覆盖多种语音任务,可复现论文结果

不足之处

  • 文档相对简略,部分高级功能需要阅读源码或社区讨论
  • 训练大型模型时对显存和计算资源要求较高

适用场景

  • 学术研究:快速复现语音识别、说话人验证等论文基线
  • 工业落地:基于预训练模型进行微调,构建语音交互、声纹识别等产品
  • 教学实验:作为语音处理课程的教学工具,演示端到端语音系统

替代项目

ESPnet、Kaldi、NeMo

上一篇:RealtimeSTT

下一篇:faster-whisper-GUI

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1627 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3834 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11861 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5662 2026-08-13