MelNet

在频域上自回归生成音频,让AI学会谱曲和说话

MelNet 是一个基于 PyTorch 的音频生成模型实现,源自论文《MelNet: A Generative Model for Audio in the Frequency Domain》。它直接在频域(梅尔频谱)上建模音频,通过自回归方式逐帧生成频谱,再转换为可听波形,解决了传统音频生成模型在时域上难以捕捉长程依赖、训练不稳定的问题。核心能力包括:多尺度自回归建模、基于梅尔频谱的音频生成、支持无条件生成和条件生成(如文本转语音)。项目提供了训练和采样代码,但未提供预训练模型,需要用户自行训练。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 208
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队Deepest-Project
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型generative-model,pytorch,tts
GitHub 星标★ 208
30天Star增速
HF 下载量
上线时间2019-08-17 00:00:00
最近更新2026-09-11 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 频域建模思路新颖,能捕捉全局结构,生成音频更连贯
  • 代码结构清晰,基于PyTorch,易于复现和二次开发
  • 支持条件生成,可扩展为TTS等下游任务

不足之处

  • 文档较少,仅有README基础说明,缺少详细教程
  • 未提供预训练模型,用户需从零训练,成本高
  • 项目维护不活跃,依赖库版本可能过旧

适用场景

  • 学术研究:复现论文结果,探索频域音频生成
  • 音乐生成:无条件生成旋律或环境音效
  • 语音合成:结合条件输入实现文本到语音

替代项目

WaveNet、SampleRNN、Tacotron

项目介绍

MelNet 是音频音乐领域的开源项目,由 Deepest-Project 开发,2019 年首次发布。

它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 208。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-11。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:学术研究:复现论文结果,探索频域音频生成。同类可对比的替代方案包括 WaveNet、SampleRNN、Tacotron。

上一篇:WG-WaveNet

下一篇:xtts-api-server

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09