Tegridy-MIDI-Dataset

一键获取高质量 MIDI 数据,加速音乐 AI 模型训练。

Tegridy-MIDI-Dataset 是一个用于音乐 AI 模型训练的高质量 MIDI 数据集项目。它解决了音乐生成、转录等任务中缺乏干净、结构化 MIDI 数据的问题,提供了一套完整的工具链,包括 MIDI 文件的收集、清洗、解析和转换,帮助开发者快速构建精准的音乐 AI 模型。项目包含大量预处理的 MIDI 文件,支持卡拉 OK 格式,并提供 Python 接口,方便集成到深度学习流程中。其核心能力在于数据标准化和增强,能够显著提升模型训练效果。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 294
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队asigalov61
所属国家
定价模式free
价格说明开源数据集,Apache-2.0 许可证,完全免费使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型artificial-intelligence,dataset,datasets,karaoke,midi,midi-converter,midi-files,midi-parser,midi-seeds,midis-datasets,multi-track,musenet,music,music-ai,music-clip,music-composition,music-generation,music-library,rock-trios,tegridy
GitHub 星标★ 294
30天Star增速
HF 下载量
上线时间2020-09-25 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

核心亮点

  • 提供大量预清洗的 MIDI 文件,节省数据预处理时间
  • 内置 MIDI 解析和转换工具,支持多种格式兼容
  • 专为音乐 AI 设计,数据标注和结构清晰

不足之处

  • 项目处于早期阶段,文档和社区支持有待完善
  • 数据集规模相对有限,可能不覆盖所有音乐风格

适用场景

  • 训练音乐生成模型(如旋律生成、伴奏生成)
  • 开发音乐转录或音符识别系统
  • 构建卡拉 OK 或歌词对齐应用

替代项目

Lakh MIDI Dataset、MAESTRO Dataset、GiantMIDI-Piano

项目介绍

Tegridy-MIDI-Dataset 是数据集领域的开源项目,由 asigalov61 开发,2020 年首次发布。

它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 294。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。开源数据集,Apache-2.0 许可证,完全免费使用。

它主要面向的使用场景是:训练音乐生成模型(如旋律生成、伴奏生成)。同类可对比的替代方案包括 Lakh MIDI Dataset、MAESTRO Dataset、GiantMIDI-Piano。

上一篇:label-studio

下一篇:caselaw-repo-1

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09