WavTokenizer

每秒40个token,让音频语言建模又快又准

WavTokenizer 是一个先进的离散声学编解码器模型,专为音频语言建模设计,在 ICLR 2025 发表。它解决了传统音频编解码器在极低码率下保留语义和声学细节的难题,核心能力是以每秒仅 40 或 75 个 token 的超低帧率对音频进行高质量编码,同时保持卓越的重建质量和语义理解。该模型支持多种音频类型,包括语音、音乐和通用声音,并提供了预训练模型和易于使用的 Python 接口,方便研究人员和开发者快速集成到音频生成、理解等任务中。其创新点在于通过极简的 token 序列捕获丰富的音频信息,显著降低了音频语言模型的计算和存储开销,为高效音频 AI 应用提供了新基础。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1321
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队jishengpeng
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型acoustic,audio-representation,codec,dac,encodec,gpt4o,music-representation-learning,semantic,soundstream,speech-language-model,speech-representation,text-to-speech
GitHub 星标★ 1321
30天Star增速
HF 下载量
上线时间2024-08-29 00:00:00
最近更新2026-09-16 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:入门 约 15 分钟 部署方式:本地安装 6 步

环境要求

  • 已安装 Conda(可创建 conda 环境)
  • Python 3.9(README 指定 python=3.9)
  • 能访问 GitHub 与 HuggingFace 下载代码和模型权重
  • 磁盘空间用于存放预训练 checkpoint(README 未给出具体大小)

安装与启动步骤

  1. 1克隆项目仓库

    从 GitHub 拉取 WavTokenizer 源码,后续依赖文件和配置文件都在仓库内,需先进入仓库目录再执行后续命令。

    git clone https://github.com/jishengpeng/WavTokenizer.git
    cd WavTokenizer
  2. 2创建 conda 环境

    README 明确要求 Python 3.9,建议用独立环境避免依赖冲突;环境名按 README 使用 wavtokenizer。

    conda create -n wavtokenizer python=3.9
  3. 3激活环境

    激活刚创建的 wavtokenizer 环境,之后所有安装和运行命令都要在该环境下执行。

    conda activate wavtokenizer
  4. 4安装依赖

    在仓库根目录根据 requirements.txt 安装 Python 依赖;若下载缓慢可自行配置国内 pip 镜像。

    pip install -r requirements.txt
  5. 5修改配置文件

    README 的 Step2 说明需要修改配置文件,但节选未给出具体内容和参数项,请以仓库中实际配置文件为准。

  6. 6下载预训练权重

    README 提到模型 checkpoint 发布在 HuggingFace 的 novateur 账号下,需按所选版本下载权重后再推理。

如何确认成功

README 未提供验证命令;确认 conda 环境已激活、依赖安装无报错,并能加载仓库配置文件即可。

常见问题

Q:没有安装 Conda 怎么办?

A:README 的安装方式基于 conda,可先安装 Miniconda 或 Anaconda,再按 conda create/activate 命令创建并激活环境。

Q:必须用 Python 3.9 吗?

A:README 给出的创建命令明确指定 python=3.9,建议照此执行以避免依赖不兼容。

Q:预训练模型在哪里下载?

A:README 提到 checkpoint 发布在 HuggingFace 的 novateur 账号下,例如 WavTokenizer-large-speech-75token 及 medium/large 集合。

Q:WavTokenizer 支持哪些音频类型?

A:README 说明可表示语音、音乐和通用音频,每秒仅需 40 个 token,重建质量与语义信息较强。

注意事项

  • 本项目面向音频语言建模,可在极低码率(40 或 75 token/秒)下编码语音、音乐和通用音频。
  • README 节选缺少 Step2 配置文件修改的具体内容,配置项需以仓库实际文件为准,切勿照搬猜测参数。
  • 模型权重需另行从 HuggingFace 下载,README 未给出一键下载命令。
  • 论文发表于 ICLR 2025,引用信息见 README 中的 BibTeX。

核心亮点

  • 超低 token 率(40/75 tokens/s),大幅降低计算和存储成本
  • 在极低码率下保持高保真音频重建和语义完整性
  • 支持语音、音乐、通用音频多种类型,预训练模型开箱即用

不足之处

  • 文档/社区待观察
  • 对极高采样率或复杂声场场景可能仍需调优

适用场景

  • 音频语言模型(如 GPT-4o)的输入前端
  • 低带宽音频传输与存储
  • 音乐和语音生成任务中的高效表征

替代项目

EnCodec、DAC、SoundStream

项目介绍

WavTokenizer 是音频音乐领域的开源项目,由 jishengpeng 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,321)位列前 30%,在音频音乐分类的 738 个项目里位列前 14%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-16。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:音频语言模型(如GPT-4o)的输入前端。同类可对比的替代方案包括 EnCodec、DAC、SoundStream。

上一篇:merlin

下一篇:audio-webui

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09