best-rq-pytorch 是语音识别领域的开源项目,由 lucasnewman 开发,2023 年首次发布。
它收录于语音识别分类,该分类目前共有 212 个项目,GitHub 星标数为 137。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-07-31。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:学术研究:复现BEST-RQ并对比其他自监督方法。同类可对比的替代方案包括 fairseq、wav2vec 2.0、HuBERT。

用随机投影量化器,轻松复现 Google 自监督语音预训练模型
BEST-RQ 是一种自监督语音表示学习模型,由 Google 提出,核心思想是用随机投影量化器(Random Projection Quantizer)替代传统对比学习中的负样本对,简化训练流程。本项目是其在 PyTorch 下的开源实现,旨在让研究者无需依赖 TensorFlow 或 Google 内部代码即可复现和实验。它解决的是语音预训练中标签依赖和训练复杂的问题,通过随机投影将连续语音特征离散化为 token,再配合掩码预测任务学习通用语音表征。项目提供模型定义、训练逻辑和基础工具,支持自动语音识别、语音合成等下游任务。代码结构清晰,适合作为学习自监督语音模型的参考实现。
fairseq、wav2vec 2.0、HuBERT
best-rq-pytorch 是语音识别领域的开源项目,由 lucasnewman 开发,2023 年首次发布。
它收录于语音识别分类,该分类目前共有 212 个项目,GitHub 星标数为 137。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-07-31。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:学术研究:复现BEST-RQ并对比其他自监督方法。同类可对比的替代方案包括 fairseq、wav2vec 2.0、HuBERT。
下一篇:speech-android
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper