POP909-Dataset

下载909首流行歌标注数据,快速训练音乐编曲AI模型

POP909-Dataset 是一个面向流行音乐编曲生成研究的开源数据集,由上海交通大学缪斯实验室发布,对应论文《POP909: A Pop-song Dataset for Music Arrangement Generation》。该数据集包含909首流行歌曲的完整标注,涵盖旋律、和弦、低音、鼓组等多个音轨的分离与对齐,并提供了小节级、节拍级的音乐结构信息。它解决了音乐编曲任务中缺乏高质量、大规模标注数据的问题,为研究人员提供了标准化的训练与评估基准。核心能力包括:多轨MIDI标注、和弦进行标注、主旋律与副旋律区分、以及歌曲结构分析。该数据集支持音乐生成、自动编曲、和弦识别、旋律提取等多项研究任务,是音乐信息检索(MIR)领域的重要资源。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 408
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队music-x-lab
所属国家
官网地址
定价模式free
价格说明开源数据集,MIT许可证,完全免费使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型dataset,deep-learning,jupyter-notebook,music,music-generation,python
GitHub 星标★ 408
30天Star增速
HF 下载量
上线时间2020-07-26 00:00:00
最近更新2026-09-24 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 909首流行歌曲的完整多轨MIDI标注,覆盖旋律、和弦、贝斯、鼓等,数据规模在同类中领先
  • 提供小节级和节拍级的结构标注,方便进行音乐生成和编曲任务的细粒度研究
  • 附带官方论文和详细文档,数据格式清晰,易于加载和使用

不足之处

  • 数据标注基于人工,可能存在主观误差,且更新频率低
  • 仅提供MIDI标注,不含原始音频,需自行获取音频进行对齐
  • 文档/社区待观察

适用场景

  • 学术研究:用于音乐信息检索、自动编曲、和弦识别等课题的基准数据集
  • AI音乐创作:训练模型生成流行风格的伴奏或编曲,辅助音乐人创作
  • 音乐教育:分析流行歌曲的和声与结构,用于教学演示

替代项目

Lakh MIDI Dataset、MAESTRO Dataset、GuitarPro Dataset

项目介绍

POP909-Dataset 是数据集领域的开源项目,由 music-x-lab 开发,2020 年首次发布。

它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 408。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-24。开源数据集,MIT许可证,完全免费使用。

它主要面向的使用场景是:学术研究:用于音乐信息检索、自动编曲、和弦识别等课题的基准数据集。同类可对比的替代方案包括 Lakh MIDI Dataset、MAESTRO Dataset、GuitarPro Dataset。

上一篇:Speech-Corpus-Collection

下一篇:ComMU-code

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09