项目预览
项目数据
项目介绍
Star 增长趋势
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
技术标签
使用教程
—
环境要求
- Python 环境(README 未指定具体版本)
- 已安装 PyTorch(SpeechBrain 是 PyTorch 工具包)
- pip 可正常联网安装包
- 从 GitHub 安装时需已安装 git
安装与启动步骤
-
1PyPI 安装
最简安装方式,适合只想直接调用 SpeechBrain 功能的用户,一条命令即可完成。
pip install speechbrain -
2验证导入
在 Python 中导入 speechbrain,不报错说明包已装好。
import speechbrain as sb -
3克隆仓库
如需做实验或二次开发,先从 GitHub 拉取源码到本地。
git clone https://github.com/speechbrain/speechbrain.git cd speechbrain -
4安装依赖
安装仓库根目录 requirements.txt 中列出的全部依赖包。
pip install -r requirements.txt -
5可编辑安装
以 --editable 方式安装,之后对包的修改会自动生效。
pip install --editable . -
6测试安装
跑仓库自带测试,确认安装无误。
pytest tests pytest --doctest-modules speechbrain -
7运行训练实验
进入具体任务的 recipe 目录,指定 YAML 参数文件启动训练,结果存入 output_folder。
cd recipes// / python experiment.py params.yaml
关键配置
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
output_folder | 是 | YAML 参数文件中指定,训练结果会保存到该目录 | output_folder |
如何确认成功
运行 pytest tests 与 pytest --doctest-modules speechbrain,或在 Python 中 import speechbrain as sb 无报错。
常见问题
Q:PyPI 安装和 GitHub 安装该选哪个?
A:只想调用功能、做推理用 pip install speechbrain;需要做实验或定制 toolkit,则从 GitHub 克隆并 pip install --editable .
Q:--editable 安装有什么好处?
A:README 说明该标志可让对 speechbrain 包的任何修改自动生效,方便边改边用。
Q:训练结果保存在哪里?
A:保存在参数 YAML 文件里指定的 output_folder 目录中。
Q:怎么跑某个任务的训练?
A:进入 recipes/
注意事项
- README 未给出支持的 Python 版本,建议先确认本地 Python 与 PyTorch 兼容
- recipes 路径需按实际数据集与任务替换,不能照抄占位符
- 从 GitHub 安装前需先 cd 进克隆下来的 speechbrain 目录
- 推理与微调可参考官网及 HuggingFace 上的预训练模型页面
核心亮点
- 模块化设计,各组件(特征、模型、解码器)可自由组合,便于研究和定制
- 内置大量预训练模型和 HuggingFace 集成,开箱即用,推理部署方便
- 提供丰富的训练配方(recipes),覆盖多种语音任务,可复现论文结果
不足之处
- 文档相对简略,部分高级功能需要阅读源码或社区讨论
- 训练大型模型时对显存和计算资源要求较高
适用场景
- 学术研究:快速复现语音识别、说话人验证等论文基线
- 工业落地:基于预训练模型进行微调,构建语音交互、声纹识别等产品
- 教学实验:作为语音处理课程的教学工具,演示端到端语音系统
替代项目
ESPnet、Kaldi、NeMo
上一篇:RealtimeSTT
同类项目推荐
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper