遇见数据集

SheetSage-A2S Dataset

收藏
arXiv2026-08-06 更新2026-08-08 收录
官方服务:

资源简介:

SheetSage-A2S数据集是由多所大学联合创建的首个面向流行音乐的音频到乐谱转录专用数据集,旨在填补该领域研究空白。该数据集包含9,468个音频片段,源自6,066首歌曲的2,891位艺术家,总时长约61小时,每个片段均配有**kern格式的乐谱编码。数据构建过程基于SheetSage注释和YouTube真实录音,通过八度推理和json转kern流程实现自动标注,确保了音频与乐谱的精准对齐。该数据集主要用于推动流行音乐转录研究,解决现有方法仅适用于古典音乐而缺乏真实录音数据的问题,为后续模型训练和基准测试提供了关键资源。

SheetSage-A2S dataset is the first dedicated audio-to-score transcription dataset for popular music, jointly created by multiple universities, aiming to fill the research gap in this field. This dataset contains 9,468 audio clips, originating from 6,066 songs by 2,891 artists, with a total duration of approximately 61 hours. Each clip is paired with **kern-format musical score encoding**. The data construction process is based on SheetSage annotations and real YouTube recordings, and achieves automatic annotation through octave inference and the json-to-kern workflow, ensuring precise alignment between audio and musical scores. This dataset is mainly used to advance research on popular music transcription, addressing the issue that existing methods only apply to classical music and lack real recording data, providing a critical resource for subsequent model training and benchmark testing.

创建时间:
2026-08-06
原始信息汇总

SheetSage-A2S 数据集详情

数据集概述

SheetSage-A2S 是首个面向流行音乐的音频到乐谱(Audio-to-Score, A2S)数据集,包含 61 小时的真实商业发行音频,覆盖 6,066 首歌曲,每首歌曲配有对应的 Humdrum **kern 主旋律谱(lead-sheet)编码。与现有仅依赖西方古典音乐合成录音的 A2S 数据集不同,本数据集基于真实音频构建,并同时提供演唱旋律及其和弦信息。

数据集形式

数据集以两种形式发布,包含相同的歌曲及相同的训练/验证/测试划分:

数据集名称 内容 地址
Sheetsage-A2S kern 乐谱 + YouTube 链接和时间戳 https://huggingface.co/datasets/MMR-Lab/Sheetsage-A2S
Sheetsage-A2S-MuQ MuQ 预训练特征 + kern 乐谱 https://huggingface.co/datasets/MMR-Lab/Sheetsage-A2S-MuQ

数据获取

模型检查点

  • 模型检查点公开可用于推理,托管于 Hugging Face Hub:https://huggingface.co/collections/MMR-Lab/sheetsage-a2s
  • 如需从头训练模型或进行自定义实验,需在 Hugging Face Hub 填写简短的申请表以获取数据集访问权限

下载命令示例

bash

下载数据集

hf download MMR-Lab/<SheetSage-a2s-muq> --repo-type dataset --local-dir /path/to/data/SheetSage-a2s-muq

下载检查点

hf download MMR-Lab/<checkpoints> <name>.ckpt --local-dir weights/preprocessed_muq

模型与性能

论文提出了一种基于自回归 Transformer 解码器的 A2S 模型,核心改进包括:

  • 更大的前馈网络维度(ff dim)
  • 预归一化解码器(pre-norm decoder)
  • 使用 MuQ 作为编码器替代 CNN
  • 音高/速度数据增强

整体符号错误率(SER,越低越好)

方法 SheetSage-A2S Quartets
基线 66.85 15.3
+ 1024 Pre-Norm 53.7 8.48
+ MuQ 编码器 25.39 7.16
+ 增强数据 20.92 4.98

SheetSage-A2S 分项指标

变体 总体 SER 旋律 SER 和弦 SER MV2H(越高越好)
基线 66.85 106.88 64.12 70.39
+ 1024 Pre-Norm 53.7 90.56 51.8 72.62
+ MuQ 25.39 46.21 26.76 79.38
+ 增强 20.92 38.62 22.28 85.05

使用说明

环境要求

  • Python 3.11+,CUDA 显卡
  • 系统包:ffmpegfluidsynthrubberband-cli(仅增强时需要)
  • 支持 Docker 安装

编码器与分词器选项

  • 编码器cnnmuqpreprocessed_muq
  • 分词器wordmediumoriginal

主要命令

训练: bash python train.py --ds_location MMR-Lab/Sheetsage-A2S-MuQ --encoder preprocessed_muq --tokeniser word --batch_size 8 --learning_rate 5e-5 --weight_decay 1e-3 --ff_dim_multiplier 4 --label_smoothing 0.1 --patience 5

评估: bash python run_metrics.py --checkpoint_path MMR-Lab/Sheetsage-A2S-model --ds_location MMR-Lab/Sheetsage-A2S-MuQ --encoder preprocessed_muq --tokeniser word --dataset_type lead_sheet

推理/可视化: bash python sample.py --checkpoint_path MMR-Lab/Sheetsage-A2S-model --ds_location MMR-Lab/Sheetsage-A2S-MuQ --tokeniser word --number 5

许可与引用

  • 代码基于 MIT 许可证 发布
  • 论文引用信息:
    • 标题:Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset
    • 作者:Cummins, Eoin 等
    • 发表于:ACMMM 2026,arXiv 预印本 arXiv:2608.06165

致谢与参考

搜集汇总
数据集介绍
构建方式
SheetSage-A2S数据集的构建源于对现有SheetSage注释的深度整合与再加工。研究团队从SheetSage公开的JSON文件中提取包含YouTube链接的音频片段,利用yt-dlp工具成功下载了20,072个片段,并对这些原始数据进行严格筛选:剔除无声或旋律缺失的片段后,保留16,310个候选片段。通过引入RMVPE模型对演唱旋律进行基频估计,结合预设的八度推断与起始时间偏移假设,以置信度阈值0.2筛选出9,468个高质量片段,最终将JSON格式的注释转换为**kern乐谱编码,并配以下载的音频文件,形成了包含61小时音频、9,468条标注的流行音乐数据集。
使用方法
SheetSage-A2S数据集可直接用于训练和评估音频到乐谱转换模型,其配套的**kern注释与音频对支持端到端的序列生成任务。研究者可采用自回归Transformer解码器架构,结合预训练的音频特征提取器(如MuQ)来提升模型对音乐语义的理解。数据集中包含了明确的艺术家分层划分(80%训练、10%验证、10%测试),便于进行可复现的实验对比。在评估方面,可采用符号错误率(SER)作为主要指标,并可分别计算旋律与和弦子集的SER,以细粒度衡量模型性能。此外,数据集还支持数据增强技术的应用,如音高偏移与时间伸缩,以增强模型的鲁棒性,为流行音乐自动转录领域提供了标准化的基准。
背景与挑战
背景概述
SheetSage-A2S数据集由Eoin Cummins、Zhongyi Huang等研究人员于2026年构建,旨在填补音频到乐谱转录(A2S)领域流行音乐数据稀缺的空白。该数据集包含9,468个音频片段,总时长61小时,源自6,066首歌曲,每个片段均配有对应的**kern格式的旋律与和弦注释,是首个专为流行音乐A2S研究设计的大规模真实录音数据集。其构建基于SheetSage注释,通过源分离、音高估计和八度推断等技术,实现了从商业化录音到乐谱的自动转换。该数据集的发布为A2S模型在流行音乐上的训练与评估提供了坚实基础,推动了音乐信息检索领域的发展。
当前挑战
SheetSage-A2S数据集面临的挑战主要来自两方面:领域问题与构建过程。领域上,现有A2S系统多针对古典音乐,对流行音乐的泛化能力不足,且流行音乐包含歌唱人声与伴奏的复杂混合,要求模型能够从多声道音频中准确提取旋律与和弦,同时处理节奏变化和音高偏移。构建过程中,原始SheetSage注释采用相对八度体系,需通过音高估计和置信度筛选来确定绝对音高,面临数据清洗和注释质量不一的难题;此外,音频获取涉及版权限制,导致部分数据缺失,且用户生成的注释存在风格差异,如音符粒度、和弦标注习惯等,影响模型一致性与评估准确性。
常用场景
经典使用场景
SheetSage-A2S数据集是首个面向流行音乐的音频到乐谱转录(A2S)研究的大规模真实录音数据集,包含61小时音频与9468个**kern格式的领谱注释,覆盖6066首独特歌曲。该数据集的核心应用场景是训练和评估端到端的A2S模型,使模型能够直接从真实商业音乐录音中生成人类可读的旋律与和弦符号,突破了以往A2S研究仅局限于古典音乐合成音频的局限,为流行音乐领域的自动乐谱转录提供了标准化的基准平台。
解决学术问题
该数据集解决了A2S领域长期存在的两大核心问题:一是数据匮乏,以往数据集多为合成音频,缺乏真实录音,模型泛化能力受限;二是研究范围狭窄,集中于西方古典音乐,流行音乐几乎未被涉及。SheetSage-A2S提供了大规模真实流行音乐录音与精确对齐的乐谱标注,使研究者能够探索真实世界音频中的多音色、人声演唱、和声变化等复杂场景。同时,该数据集为验证预训练音频特征(如MuQ)和数据增强策略在A2S任务中的有效性提供了重要实验基础,显著降低了符号错误率,推动了A2S技术从实验室走向实际应用。
实际应用
在实际应用中,SheetSage-A2S数据集可广泛服务于音乐产业与音乐教育领域。对于音乐制作平台,该数据集可训练自动乐谱生成系统,将录音实时转化为可编辑的领谱,辅助音乐人快速扒谱、翻唱创作或版权识别。对于在线音乐教育工具,其能帮助学生从歌曲录音中提取旋律与和弦,进行视唱练耳和和声分析练习。此外,该数据集还可支持音乐信息检索(MIR)系统的开发,如旋律检索、翻唱识别以及基于内容的音乐推荐,成为连接听觉内容与符号乐谱的桥梁。
数据集最近研究
最新研究方向
SheetSage-A2S数据集的最新研究方向聚焦于推动音频到乐谱转录(A2S)技术从古典音乐领域向流行音乐领域的拓展,通过引入真实录音和**kern乐谱编码,填补了该领域在流行音乐数据集上的空白。研究重点在于利用预训练音乐特征提取模型(如MuQ)和数据增强技术提升模型的泛化能力与转录精度,同时探索不同分词策略对转录性能的影响。该数据集的发布不仅为A2S研究提供了宝贵的真实音频资源,还通过建立基准性能(20.92%的符号错误率)激发了后续研究对复杂和声标注、节奏量化以及模型鲁棒性的优化,有望推动自动音乐转录技术在音乐信息检索和音乐教育等实际应用中的发展。
相关研究论文
  • 1
    Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset都柏林大学学院; 广西师范大学; 大湾区大学; 深圳大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务