speechbrain

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

SpeechBrain 是一个基于 PyTorch 的开源语音工具包,旨在为语音识别、说话人识别、语音增强、语音分离、情感识别等多种语音任务提供统一、灵活且易用的解决方案。它解决了语音领域研究者和开发者面临的环境碎片化、模型复现困难、训练流程复杂等问题,通过模块化设计和丰富的预训练模型,降低了语音 AI 的开发门槛。核心能力包括:支持端到端语音识别(ASR)、说话人验证与识别(Speaker ID)、语音活动检测(VAD)、语音增强与分离、以及多语言语音处理;提供大量预训练模型和 HuggingFace 集成,支持快速微调和推理;内置多种训练配方(recipes),可复现主流论文结果;基于 PyTorch,支持动态图、分布式训练和混合精度,方便自定义扩展。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 11778
维护状态 活跃
是否开源
定价模式 free

项目数据

分类语音识别
开发团队speechbrain
所属国家
定价模式free
价格说明开源免费,Apache 2.0许可证
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型asr,audio,audio-processing,deep-learning,huggingface,language-model,pytorch,speaker-diarization,speaker-recognition,speaker-verification,speech-enhancement,speech-processing,speech-recognition,speech-separation,speech-to-text,speech-toolkit,speechrecognition,spoken-language-understanding,transformers,voice-recognition
GitHub 星标★ 11778
30天Star增速
HF 下载量
上线时间2020-04-28 00:00:00
最近更新2026-08-25 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-26
浏览次数0

核心亮点

  • 模块化设计,各组件(特征、模型、解码器)可自由组合,便于研究和定制
  • 内置大量预训练模型和 HuggingFace 集成,开箱即用,推理部署方便
  • 提供丰富的训练配方(recipes),覆盖多种语音任务,可复现论文结果

不足之处

  • 文档相对简略,部分高级功能需要阅读源码或社区讨论
  • 训练大型模型时对显存和计算资源要求较高

适用场景

  • 学术研究:快速复现语音识别、说话人验证等论文基线
  • 工业落地:基于预训练模型进行微调,构建语音交互、声纹识别等产品
  • 教学实验:作为语音处理课程的教学工具,演示端到端语音系统

替代项目

ESPnet、Kaldi、NeMo

项目介绍

speechbrain 是一个语音识别领域的开源项目,官方简介:A PyTorch-based Speech Toolkit。项目使用 Python 开发,在 GitHub 上获得 11778 星标。

上一篇:RealtimeSTT

下一篇:没有了!

同类项目推荐

LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3576 2026-08-10
speaches 开源

一键部署,即刻拥有 OpenAI 兼容的语音转文字服务

★ 3617 2026-08-10
cheetah 开源

在设备上实时把语音转文字,离线低延迟还保护隐私

On-device streaming speech-to-text engine powered by deep learning

★ 670 2026-08-10
espnet 开源

语音识别、合成、翻译一把抓,一个工具箱全搞定

End-to-End Speech Processing Toolkit

★ 9939 2026-08-09