BayLing-Speech

让开源模型像GPT-4o一样自然流畅地语音对话

BayLing-Speech(即LLaMA-Omni)是一个基于Llama-3.1-8B-Instruct构建的端到端语音交互模型,旨在实现GPT-4o级别的语音能力。它解决传统级联语音系统延迟高、情感表达丢失的问题,通过统一语音-文本编码和流式解码架构,实现低延迟、高质量的语音对话。核心能力包括:同时接收文本和语音输入,流式生成文本与语音输出,支持中英文双语,并具备情感和副语言信息保留。项目提供了完整的训练、推理和评估代码,以及预训练模型权重,方便开发者复现和部署。其创新点在于将语音离散化标记与文本标记统一处理,显著降低交互延迟,同时保持高语音自然度。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3147
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队ictnlp
所属国家
官网地址
定价模式free
价格说明开源模型,Apache-2.0许可,完全免费,需自行部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型large-language-models,multimodal-large-language-models,speech-interaction,speech-language-model,speech-to-speech,speech-to-text
GitHub 星标★ 3147
30天Star增速
HF 下载量
上线时间2024-09-10 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:进阶 约 60 分钟 部署方式:本地安装 8 步

环境要求

  • Python 3.10(README 用 conda 创建 python=3.10 环境)
  • 已安装 conda 环境管理工具
  • 需能访问 GitHub 与 Hugging Face 下载仓库和模型权重
  • 需具备可编译安装 fairseq 与 flash-attn 的环境

安装与启动步骤

  1. 1克隆代码仓库

    从 GitHub 拉取 LLaMA-Omni 源码并进入项目目录,后续安装都在该目录下进行。

    git clone https://github.com/ictnlp/LLaMA-Omni
    cd LLaMA-Omni
  2. 2创建并激活环境

    用 conda 新建名为 llama-omni 的 Python 3.10 环境,注意必须激活后再装依赖。

    conda create -n llama-omni python=3.10
    conda activate llama-omni
  3. 3安装项目依赖

    先固定 pip 版本为 24.0,再以可编辑模式安装本项目自身依赖。

    pip install pip==24.0
    pip install -e .
  4. 4安装 fairseq

    单独克隆 PyTorch 官方 fairseq 仓库,关闭构建隔离进行本地安装,耗时较长。

    git clone https://github.com/pytorch/fairseq
    cd fairseq
    pip install -e . --no-build-isolation
  5. 5安装 flash-attention

    同样关闭构建隔离安装 flash-attn,编译较慢,需耐心等待且不要中断。

    pip install flash-attn --no-build-isolation
  6. 6下载语音语言模型

    从 Hugging Face 下载 Llama-3.1-8B-Omni 权重(页面手动下载),README 未给命令行。

  7. 7下载 Whisper 编码器

    用 whisper 库下载 large-v3 模型,download_root 指向 models/speech_encoder/。

    import whisper
    model = whisper.load_model("large-v3", download_root="models/speech_encoder/")
  8. 8下载声码器权重

    用 wget 拉取 unit-based HiFi-GAN 声码器的权重文件和 config.json 到 vocoder/ 目录。

    wget https://dl.fbaipublicfiles.com/fairseq/speech_to_speech/vocoder/code_hifigan/mhubert_vp_en_es_fr_it3_400k_layer11_km1000_lj/g_00500000 -P vocoder/
    wget https://dl.fbaipublicfiles.com/fairseq/speech_to_speech/vocoder/code_hifigan/mhubert_vp_en_es_fr_it3_400k_layer11_km1000_lj/config.json -P vocoder/

关键配置

配置项必填说明示例
Llama-3.1-8B-Omni是主模型权重,需从 Hugging Face 仓库下载ICTNLP/Llama-3.1-8B-Omni
download_root是Whisper large-v3 语音编码器的本地存放目录models/speech_encoder/
vocoder 目录是HiFi-GAN 声码器权重与 config.json 的存放位置vocoder/

如何确认成功

README 未给出启动验证命令;确认 pip install -e . 无报错、主模型与 Whisper、声码器文件均已完整下载即可。

常见问题

Q:fairseq 安装报编译错误怎么办?

A:README 要求在 fairseq 目录下执行 pip install -e . --no-build-isolation;请确保先激活 conda 环境且编译工具链齐全,避免使用构建隔离。

Q:flash-attn 安装非常慢或失败怎么办?

A:README 使用 pip install flash-attn --no-build-isolation,该包需从源码编译,耗时较长;建议保持网络稳定并预留足够磁盘空间后重试。

Q:为什么要先执行 pip install pip==24.0?

A:README 明确将 pip 固定到 24.0 版本,是为了保证后续 fairseq 和 flash-attn 的编译安装流程兼容,请在装其他包前执行。

Q:模型权重需要手动下载吗?

A:Llama-3.1-8B-Omni 需从 Hugging Face 页面下载;Whisper 与声码器则分别通过 whisper 库和 wget 命令自动获取。

注意事项

  • 步骤必须在激活 llama-omni 这个 conda 环境后执行,否则依赖会装到错误环境。
  • fairseq 与 flash-attn 均从源码编译,整体安装时间较长,建议预留充足时间。
  • Whisper 的 download_root 与声码器的 vocoder/ 目录需与推理代码中的路径保持一致。
  • README 节选未提供推理和评估的具体启动命令,运行前请查阅仓库完整文档。

核心亮点

  • 端到端架构,延迟低至300ms,接近实时对话体验
  • 基于Llama-3.1-8B,支持中英双语,语音自然度高
  • 开源完整训练和推理代码,模型权重可直接下载使用

不足之处

  • 模型体积较大,部署需较高显存资源
  • 文档/社区待观察

适用场景

  • 智能语音助手(如手机、车载场景)
  • 实时语音翻译与跨语言交流
  • 情感化语音交互应用(如陪伴机器人)

替代项目

Qwen-Audio、SpeechGPT、Mini-Omni

项目介绍

BayLing-Speech 是开源模型领域的开源项目,由 ictnlp 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,147)位列前 30%,在开源模型分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0许可,完全免费,需自行部署。

它主要面向的使用场景是:智能语音助手(如手机、车载场景)。同类可对比的替代方案包括 Qwen-Audio、SpeechGPT、Mini-Omni。

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10