lingvo 是语音识别领域的开源项目,由 tensorflow 开发,2018 年首次发布。
在全站 13,090 个收录项目中,它的 GitHub 星标数(2,864)位列前 30%,在语音识别分类中处于中上游。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-15。Apache-2.0许可证,可免费使用和部署。
它主要面向的使用场景是:语音识别模型的研究与实验。同类可对比的替代方案包括 ESPnet、fairseq、Kaldi。

用 Google 的序列建模框架,快速搞定语音和翻译实验
Lingvo 是 Google 开源的深度学习框架,专注于序列建模任务,尤其擅长语音识别、机器翻译和语言模型。它基于 TensorFlow 构建,提供了一套模块化、可配置的组件,让研究者能快速搭建和实验复杂的序列模型。Lingvo 的核心优势在于其高度工程化的训练流程,支持分布式训练、混合精度和大量预置模型(如 Transformer、LSTM 等),并内置了多种数据集加载和评估工具。它解决了研究代码难以复现和扩展的问题,通过统一的配置系统,让实验管理变得清晰。Lingvo 在工业界和学术界都有应用,是语音和翻译领域的重要参考实现。
1安装 lingvo
通过 pip 安装冻结版本的 Lingvo,适合直接使用框架训练自定义模型,但不易修改框架代码。
pip3 install lingvo2准备 MNIST 工作目录
创建 /tmp/mnist 目录并进入,随后下载 MNIST 模型参数文件。
mkdir -p /tmp/mnist && cd /tmp/mnist3下载模型参数
从 GitHub 拉取 MNIST 的 params 文件到当前目录,命令中已指定保存路径 /tmp/mnist。
cd /tmp/mnist && curl -O https://raw.githubusercontent.com/tensorflow/lingvo/master/lingvo/tasks/image/params/mnist.py4启动 MNIST 训练
以本地 CPU、同步模式运行 LeNet5 训练,日志写入 /tmp/mnist/log。约 20 秒后 loss 应低于 0.3。按 Ctrl+C 停止。
python3 -m lingvo.trainer --run_locally=cpu --mode=sync --model=mnist.LeNet5 --logdir=/tmp/mnist/log5运行评估任务
训练与评估应作为两个独立进程同时运行,此命令在 Test 数据集上评估已保存的 checkpoint。
python3 -m lingvo.trainer --job=evaler_test --run_locally=cpu --mode=sync --model=mnist.LeNet5 --logdir=/tmp/mnist/log| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
--run_locally | 是 | 指定本地运行模式,示例使用 cpu。 | cpu |
--mode | 是 | 训练模式,示例为同步模式。 | sync |
--model | 是 | 指定要运行的模型类名。 | mnist.LeNet5 |
--logdir | 是 | 日志与 checkpoint 输出目录。 | /tmp/mnist/log |
--job | 否 | 指定任务类型,评估时使用 evaler_test。 | evaler_test |
--logtostderr | 否 | bazel 运行方式下把日志输出到 stderr。 | --logtostderr |
训练日志中 loss 降到 0.3 以下并出现 Save checkpoint;评估日志出现 accuracy 与 acc5 数值即成功。
Q:pip 安装和源码安装怎么选?
A:只想使用框架训练自定义模型选 pip;需要修改框架代码或实现自定义算子则克隆仓库用 bazel 构建。
Q:MNIST 训练和评估能只跑一个进程吗?
A:正常设置下 trainer 与 evaler 应作为两个独立进程同时运行。
Q:没有 GPU 能跑 MNIST 示例吗?
A:可以,README 的示例就是 --run_locally=cpu,其他大型模型才需要 GPU 集群。
Q:评估任务什么时候停?
A:它会等待新 checkpoint,出现 No new check point is found 时可用 Ctrl+C 停止。
ESPnet、fairseq、Kaldi
lingvo 是语音识别领域的开源项目,由 tensorflow 开发,2018 年首次发布。
在全站 13,090 个收录项目中,它的 GitHub 星标数(2,864)位列前 30%,在语音识别分类中处于中上游。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-15。Apache-2.0许可证,可免费使用和部署。
它主要面向的使用场景是:语音识别模型的研究与实验。同类可对比的替代方案包括 ESPnet、fairseq、Kaldi。
下一篇:phonikud
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper