TensorFlowASR

用 TF2 快速训练和部署端到端语音识别模型

TensorFlowASR 是一个基于 TensorFlow 2 的开源端到端语音识别工具箱,目标是在 TensorFlow 生态中提供接近当前最优(Almost State-of-the-art)的 ASR 能力。它解决了研究者和工程师在 TF2 上缺少统一、可复现语音识别实现的问题,把主流模型结构集中到一个代码库中,包括 Conformer、ContextNet、Jasper、DeepSpeech2 以及 RNN-Transducer 等,并支持 CTC 与 Transducer 两类训练目标。项目同时提供字符级和子词(subword)建模,方便处理中文、英文等不同语言,也支持自定义词表。整体设计强调配置驱动,用户通过 YAML 文件即可切换模型、数据集与解码方式,配套有数据预处理、训练、评估和推理脚本,适合做语音识别实验、模型对比以及二次开发。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1011
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类语音识别
开发团队TensorSpeech
所属国家
定价模式free
价格说明开源免费,基于 TensorFlow 2 的 ASR 模型库
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型automatic-speech-recognition,conformer,contextnet,ctc,deepspeech2,end2end,jasper,rnn-transducer,speech-recognition,speech-to-text,streaming-transducer,subword-speech-recognition,tensorflow,tensorflow2,tflite,tflite-convertion,tflite-model
GitHub 星标★ 1011
30天Star增速
HF 下载量
上线时间2020-02-13 00:00:00
最近更新2026-09-28 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-01
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 7 步

环境要求

  • Python 3.12 或 3.13
  • 已安装 uv 包管理器
  • git(需要 git clone 拉取仓库)
  • 可选:NVIDIA GPU(安装 cuda extra)
  • 可选:Docker 与 docker-compose(容器方式运行)

安装与启动步骤

  1. 1克隆项目仓库

    README 明确要求用 git clone 安装,因为训练和测试还需要 ctc_decoders、rnnt_loss 等第三方包。

    git clone https://github.com/TensorSpeech/TensorFlowASR.git
    cd TensorFlowASR
  2. 2安装默认依赖

    普通 uv sync 会安装 tensorflow 与 tensorflow-text,CPU 和 Apple Silicon 用这一条即可。

    uv sync
  3. 3可选装GPU支持

    NVIDIA 显卡用户改用带 cuda extra 的命令,会安装 tensorflow[and-cuda]。

    uv sync --extra cuda
  4. 4可选装开发工具

    需要 pytest、ruff、pre-commit 等开发与导出工具时追加 dev extra。

    uv sync --extra dev
  5. 5验证命令行

    README 示例用 uv run 在环境中执行命令,能打印帮助信息说明安装完成。

    uv run tensorflow_asr --help
  6. 6可选:安装TPU版

    Cloud TPU 不是 extra,需先 sync 再跑脚本;脚本会先卸载原版 tensorflow 再装 TPU 版。

    uv sync && ./scripts/install_tpu.sh
  7. 7可选:容器启动

    README 在 Installation 中给出容器运行方式,直接用 docker-compose 后台启动。

    docker-compose up -d

关键配置

配置项必填说明示例
extra: cuda否在 pyproject.toml 中声明,安装 tensorflow[and-cuda] 供 NVIDIA GPU 使用uv sync --extra cuda
extra: dev否安装 pytest、ruff、pre-commit、绘图与导出工具uv sync --extra dev
_(无 extra)是默认只装 tensorflow 与 tensorflow-text,适合 CPU 与 Apple Siliconuv sync

如何确认成功

执行 uv run tensorflow_asr --help 能正常输出帮助信息;容器方式可确认 docker-compose up -d 后容器处于运行状态。

常见问题

Q:为什么必须用 git clone 而不是 pip 安装?

A:README 说明训练和测试需要从其他作者处安装 ctc_decoders、rnnt_loss 等必要包,因此官方推荐 clone 仓库后安装。

Q:没有 NVIDIA 显卡能装吗?

A:可以。普通 uv sync 安装的 tensorflow + tensorflow-text 在 CPU 和 Apple Silicon 上都能用,GPU 支持是可选的 cuda extra。

Q:Cloud TPU 直接加 extra 行不行?

A:不行。README 说明 tensorflow-tpu 自带一份 tensorflow 发行版,只能用 ./scripts/install_tpu.sh 安装,否则两个版本会互相覆盖。

Q:TPU 安装后重新 uv sync 会有问题吗?

A:会。后续任何 uv sync 都会把原版 tensorflow 装回来,需要重新执行 ./scripts/install_tpu.sh。

Q:可以用 Docker 跑吗?

A:可以,README 的 Installation 中给出 docker-compose up -d,即可在容器中启动。

注意事项

  • Python 版本要求为 3.12 或 3.13,版本不符可能导致安装失败。
  • 项目使用 uv 作为包管理器,所有命令建议通过 uv run 在项目环境中执行。
  • README 本节只给出安装方式,训练、推理、TFLite 转换等具体用法需查阅对应 Tutorial 与 Inference 章节。
  • TPU 脚本会卸载并覆盖原版 tensorflow,且每次 uv sync 后都要重跑。

核心亮点

  • 模型覆盖全,Conformer、ContextNet、Jasper、DeepSpeech2、RNN-T 一库集成
  • 支持字符与 subword 两种建模,方便中英文等多语言场景
  • 配置驱动,YAML 切换模型与数据集,训练推理脚本完整

不足之处

  • 相比 ESPnet、WeNet 等社区,文档与教程仍偏少,上手需读源码
  • 预训练模型和中文数据配方有限,开箱即用程度一般

适用场景

  • 在 TF2 技术栈中训练自定义语音识别模型
  • 做 Conformer、RNN-T 等结构对比实验
  • 为已有 TensorFlow 服务添加语音识别能力

替代项目

ESPnet、WeNet、K2/icefall

项目介绍

TensorFlowASR 是语音识别领域的开源项目,由 TensorSpeech 开发,2020 年首次发布。

在全站 13,465 个收录项目中,它的 GitHub 星标数(1,011)位列前 30%,在语音识别分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-28。开源免费,基于 TensorFlow 2 的 ASR 模型库。

它主要面向的使用场景是:在TF2技术栈中训练自定义语音识别模型。同类可对比的替代方案包括 ESPnet、WeNet、K2/icefall。

上一篇:mlx-qwen3-asr

下一篇:asryx

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1619 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3786 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11848 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5659 2026-08-13