FireRedASR

中文方言和歌唱都能准确识别的开源ASR模型

FireRedASR 是一个开源的工业级自动语音识别(ASR)模型,主要面向中文普通话、中文方言和英语的语音转文字场景。它解决了传统ASR模型在中文方言和复杂音频环境下识别率低的问题,在公开中文基准测试上达到了新的SOTA(最优)水平。核心能力包括高精度的普通话识别、多种方言支持、英文识别,以及独特的歌唱歌词识别功能,可应用于会议转写、视频字幕生成、语音搜索等场景。模型基于深度学习,提供Python接口,便于集成到各类应用中。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1994
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队FireRedTeam
所属国家
官网地址
定价模式free
价格说明开源模型,Apache-2.0许可,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型asr,automatic-speech-recognition,conformer,industrial-grade,llm,multimodal-llm,open-source,speech-recognition,speechllm,transformer
GitHub 星标★ 1994
30天Star增速
HF 下载量
上线时间2025-01-24 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 8 步

环境要求

  • Python 3.10(README 使用 conda 创建 python=3.10 环境)
  • conda(Anaconda/Miniconda)用于创建虚拟环境
  • git,用于克隆仓库与下载模型
  • ffmpeg,用于把音频转成 16kHz 16-bit PCM
  • 足够磁盘空间存放 pretrained_models 下的模型权重

安装与启动步骤

  1. 1克隆项目仓库

    把 FireRedASR 源码下载到本地,后续所有命令都在该仓库根目录执行。

    git clone https://github.com/FireRedTeam/FireRedASR.git
  2. 2创建 Python 环境

    新建名为 fireredasr 的 conda 环境并指定 Python 3.10,避免污染系统环境。

    conda create --name fireredasr python=3.10
  3. 3激活环境

    切换到刚创建的环境,之后安装依赖和运行脚本都要在该环境中进行。

    conda activate fireredasr
  4. 4安装依赖

    在仓库根目录按 requirements.txt 安装 Python 依赖,网络慢时可换国内镜像源。

    pip install -r requirements.txt
  5. 5配置路径变量

    在仓库根目录设置 Linux PATH 与 PYTHONPATH,使 speech2text.py 等脚本可直接调用。

    export PATH=$PWD/fireredasr/:$PWD/fireredasr/utils/:$PATH
    export PYTHONPATH=$PWD/:$PYTHONPATH
  6. 6下载模型权重

    从 huggingface 的 fireredteam 下载模型放到 pretrained_models 目录;用 LLM-L 时还需下载 Qwen2-7B-Instruct 并在 FireRedASR-LLM-L 目录内建软链接。

    ln -s ../Qwen2-7B-Instruct
  7. 7转换音频格式

    模型要求 16kHz、单声道、16-bit PCM 的 wav,用 ffmpeg 先把输入音频转好。

    ffmpeg -i input_audio -ar 16000 -ac 1 -acodec pcm_s16le -f wav output.wav
  8. 8运行推理脚本

    进入 examples 目录执行官方示例脚本,先后运行 AED 与 LLM 两个版本的推理。

    cd examples
    bash inference_fireredasr_aed.sh
    bash inference_fireredasr_llm.sh

关键配置

配置项必填说明示例
--wav_path是待识别的音频文件路径,需为 16kHz wavexamples/wav/BAC009S0764W0121.wav
--asr_type是选择识别模型类型:aed 或 llmaed
--model_dir是模型权重所在目录pretrained_models/FireRedASR-AED-L

如何确认成功

执行 speech2text.py 对示例音频推理,能正常输出识别文本即部署成功;具体命令可在仓库根目录运行 speech2text.py --help 查看。

常见问题

Q:模型权重应该放在哪里?

A:README 要求从 huggingface 的 fireredteam 下载后统一放到项目根目录下的 pretrained_models 文件夹中。

Q:FireRedASR-LLM-L 为什么跑不起来?

A:它除自身权重外还需 Qwen2-7B-Instruct,下载后放进 pretrained_models,并在 FireRedASR-LLM-L 目录执行 ln -s ../Qwen2-7B-Instruct。

Q:提示找不到 speech2text.py 命令怎么办?

A:需先执行 export PATH=$PWD/fireredasr/:$PWD/fireredasr/utils/:$PATH 和 export PYTHONPATH=$PWD/:$PYTHONPATH,并在仓库根目录执行。

Q:可以直接用 mp3 等音频吗?

A:README 建议先用 ffmpeg 转成 16kHz、单声道、16-bit PCM 的 wav,否则可能读取失败。

注意事项

  • 所有命令默认在克隆后的 FireRedASR 仓库根目录执行,路径变量依赖当前目录。
  • 官方已开源升级版 FireRedASR2S(含 ASR、VAD、LID、Punc 模块),新用户可考虑直接使用。
  • README 未说明显存/CPU 具体要求,实际运行前建议确认硬件是否能承载所选模型规模。

核心亮点

  • 在中文普通话基准上刷新SOTA,识别精度领先
  • 支持方言和歌唱歌词识别,场景覆盖广
  • 工业级设计,易于部署和集成到实际产品

不足之处

  • 文档/社区待观察
  • 对非中文语言(如英语)的优化可能不如中文突出

适用场景

  • 中文会议和课堂录音转写
  • 视频平台自动生成中文字幕
  • 音乐App歌词识别与卡拉OK字幕

替代项目

FunASR、WeNet、Whisper

项目介绍

FireRedASR 是语音识别领域的开源项目,由 FireRedTeam 开发,2025 年首次发布。

在全站 13,109 个收录项目中,它的 GitHub 星标数(1,994)位列前 30%,在语音识别分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,955 增加到 1,994,净增 39。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0许可,可免费使用和部署。

它主要面向的使用场景是:中文会议和课堂录音转写。同类可对比的替代方案包括 FunASR、WeNet、Whisper。

上一篇:WhisperJAV

下一篇:Llama-AVSR

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13