best-rq-pytorch

用随机投影量化器,轻松复现 Google 自监督语音预训练模型

BEST-RQ 是一种自监督语音表示学习模型,由 Google 提出,核心思想是用随机投影量化器(Random Projection Quantizer)替代传统对比学习中的负样本对,简化训练流程。本项目是其在 PyTorch 下的开源实现,旨在让研究者无需依赖 TensorFlow 或 Google 内部代码即可复现和实验。它解决的是语音预训练中标签依赖和训练复杂的问题,通过随机投影将连续语音特征离散化为 token,再配合掩码预测任务学习通用语音表征。项目提供模型定义、训练逻辑和基础工具,支持自动语音识别、语音合成等下游任务。代码结构清晰,适合作为学习自监督语音模型的参考实现。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 137
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队lucasnewman
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型automatic-speech-recognition,speech-synthesis,text-to-speech
GitHub 星标★ 137
30天Star增速
HF 下载量
上线时间2023-09-25 00:00:00
最近更新2026-07-31 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 忠实复现 Google 官方 BEST-RQ 架构,降低复现门槛
  • 纯 PyTorch 实现,便于集成到现有深度学习工作流
  • 代码简洁,适合作为自监督语音学习的研究起点

不足之处

  • 早期项目,文档和示例较少,上手需一定背景
  • 未提供预训练权重,需自行训练才能用于下游任务

适用场景

  • 学术研究:复现 BEST-RQ 并对比其他自监督方法
  • 语音预训练:为低资源语音任务生成通用表征
  • 教学演示:理解随机投影量化在自监督学习中的作用

替代项目

fairseq、wav2vec 2.0、HuBERT

项目介绍

best-rq-pytorch 是语音识别领域的开源项目,由 lucasnewman 开发,2023 年首次发布。

它收录于语音识别分类,该分类目前共有 212 个项目,GitHub 星标数为 137。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-07-31。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:学术研究:复现BEST-RQ并对比其他自监督方法。同类可对比的替代方案包括 fairseq、wav2vec 2.0、HuBERT。

上一篇:spokestack-python

下一篇:speech-android

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13