
speechbrain
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
SpeechBrain 是一个基于 PyTorch 的开源语音工具包,旨在为语音识别、说话人识别、语音增强、语音分离、情感识别等多种语音任务提供统一、灵活且易用的解决方案。它解决了语音领域研究者和开发者面临的环境碎片化、模型复现困难、训练流程复杂等问题,通过模块化设计和丰富的预训练模型,降低了语音 AI 的开发门槛。核心能力包括:支持端到端语音识别(ASR)、说话人验证与识别(Speaker ID)、语音活动检测(VAD)、语音增强与分离、以及多语言语音处理;提供大量预训练模型和 HuggingFace 集成,支持快速微调和推理;内置多种训练配方(recipes),可复现主流论文结果;基于 PyTorch,支持动态图、分布式训练和混合精度,方便自定义扩展。
开源
free
语音识别
GitHub 星标
★ 11778
维护状态
活跃
是否开源
是
定价模式
free
项目数据
分类语音识别
开发团队speechbrain
所属国家
定价模式free
价格说明开源免费,Apache 2.0许可证
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型asr,audio,audio-processing,deep-learning,huggingface,language-model,pytorch,speaker-diarization,speaker-recognition,speaker-verification,speech-enhancement,speech-processing,speech-recognition,speech-separation,speech-to-text,speech-toolkit,speechrecognition,spoken-language-understanding,transformers,voice-recognition
GitHub 星标★ 11778
30天Star增速
HF 下载量
上线时间2020-04-28 00:00:00
最近更新2026-08-25 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-26
浏览次数0
核心亮点
- 模块化设计,各组件(特征、模型、解码器)可自由组合,便于研究和定制
- 内置大量预训练模型和 HuggingFace 集成,开箱即用,推理部署方便
- 提供丰富的训练配方(recipes),覆盖多种语音任务,可复现论文结果
不足之处
- 文档相对简略,部分高级功能需要阅读源码或社区讨论
- 训练大型模型时对显存和计算资源要求较高
适用场景
- 学术研究:快速复现语音识别、说话人验证等论文基线
- 工业落地:基于预训练模型进行微调,构建语音交互、声纹识别等产品
- 教学实验:作为语音处理课程的教学工具,演示端到端语音系统
替代项目
ESPnet、Kaldi、NeMo
项目介绍
上一篇:RealtimeSTT
下一篇:没有了!
同类项目推荐
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speaches
开源
一键部署,即刻拥有 OpenAI 兼容的语音转文字服务
cheetah
开源
在设备上实时把语音转文字,离线低延迟还保护隐私
On-device streaming speech-to-text engine powered by deep learning
espnet
开源
语音识别、合成、翻译一把抓,一个工具箱全搞定
End-to-End Speech Processing Toolkit