ultravox

让AI语音对话快如真人,实时响应不卡顿

ultravox 是一个专注于实时语音交互的多模态大语言模型(LLM),旨在解决传统语音助手延迟高、交互不自然的问题。它通过将音频直接作为输入模态与文本联合建模,实现了低至数百毫秒的端到端语音对话,无需传统的语音识别(ASR)和语音合成(TTS)流水线。核心能力包括:流式音频输入输出、支持打断和实时响应、基于Llama等开源基座模型微调、提供简洁的Python API和WebSocket接口。项目采用Python编写,依赖HuggingFace生态,支持自定义数据集训练和推理部署。其设计强调速度与自然度,适合构建实时语音代理、语音交互应用等场景。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4567
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队fixie-ai
所属国家
定价模式free
价格说明开源模型,MIT许可证,可免费本地部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型ai,llm,slm,speech
GitHub 星标★ 4567
30天Star增速
HF 下载量
上线时间2024-05-29 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 6 步

环境要求

  • MacOS 系统(README 的环境配置章节以 Mac 为例;Debian/Ubuntu 可用 apt 替代 Homebrew)
  • Homebrew 包管理器
  • Just 命令行工具(项目脚本统一入口)
  • pyenv(因项目使用 Poetry,推荐用它管理环境)
  • Python 3.11

安装与启动步骤

  1. 1安装 Homebrew

    MacOS 的包管理器,后续工具都通过它安装;Linux 用户可改用 apt。

    /bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
  2. 2更新并安装 Just

    先更新 Homebrew 索引,再安装 Just;Just 是项目所有 shell 工作流的统一入口。

    brew update
    brew install just
  3. 3安装 pyenv 依赖

    先装 xz,再装 pyenv,用于管理隔离的 Python 版本环境。

    brew install xz
    brew install pyenv
  4. 4初始化 pyenv

    执行 pyenv init 让 shell 能识别 pyenv 安装的 Python 版本。

    pyenv init
  5. 5安装 Python 3.11

    安装并使用 Python 3.11 作为全局版本,项目依赖 Poetry 对版本有要求。

    pyenv install 3.11
    pyenv global 3.11
  6. 6运行评估或推理

    在仓库根目录执行,config 文件指定模型、数据集和推理/评估配置。

    just eval --config_path ultravox/evaluation/configs/eval_config.yaml

关键配置

配置项必填说明示例
eval_config.yaml是评估/推理配置文件,指定所用模型、数据集及相关参数ultravox/evaluation/configs/eval_config.yaml
数据集配置目录否README 中数据集配置文件所在目录,需含 eval_config 字段ultravox/data/configs/
registry.py否自定义数据集需在此注册后才能被识别使用ultravox/data/registry.py

如何确认成功

执行 just eval 命令后无报错并正常输出推理/评估结果,即说明环境配置成功。

常见问题

Q:Linux 用户能不能按这个流程装?

A:README 说明 Debian 或 Ubuntu 可以用 apt 替代 Homebrew 完成基础工具安装,其余 pyenv、Python 3.11 的步骤思路一致。

Q:为什么要用 pyenv 而不是系统自带 Python?

A:README 指出由于项目使用 Poetry 管理依赖,推荐用 pyenv 管理 Python 环境,避免版本冲突。

Q:数据集不在项目里怎么办?

A:需在 ultravox/data/configs/ 下新建数据集配置文件(带 eval_config 字段指定评估指标与参数),并在 ultravox/data/registry.py 中注册。

Q:只看到评估命令,怎么做推理?

A:README 说明推理和评估共用同一入口,通过 just eval 加 --config_path 指定配置即可完成推理或评估。

注意事项

  • README 节选只给出了 Mac 环境搭建和评估/推理入口,未包含完整的安装与部署全流程。
  • 命令需在项目仓库根目录下执行,否则找不到 ultravox/ 下的配置文件路径。
  • pyenv 安装后可能需要按 pyenv init 的提示修改 shell 配置文件才能生效。

核心亮点

  • 端到端语音建模,免去ASR/TTS级联,延迟显著降低
  • 支持流式输入输出,可实现打断和实时对话
  • 基于Llama等开源模型,易于微调和定制

不足之处

  • 模型训练和推理资源需求较高,轻量部署有门槛
  • 文档/社区待观察

适用场景

  • 实时语音助手/智能客服
  • 语音交互游戏或虚拟角色
  • 会议纪要实时语音转写与问答

替代项目

Qwen-Audio、SpeechGPT、Moshi

项目介绍

ultravox 是开源模型领域的开源项目,由 fixie-ai 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(4,567)位列前 10%,在开源模型分类的 424 个项目里位列前 13%。

近 41 天,它的 GitHub 星标从 4,537 增加到 4,567,净增 30。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,可免费本地部署使用。

它主要面向的使用场景是:实时语音助手/智能客服。同类可对比的替代方案包括 Qwen-Audio、SpeechGPT、Moshi。

上一篇:mockserver-monorepo

下一篇:GLM-4.5

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
awesome-ltx2 开源

找齐 LTX-2 模型、工作流和 LoRA,一键上手视频生成。

All available LTX-2 models, encoders, workflows, LoRAs for ComfyUI

★ 593 2026-08-10