SheetSage-A2S Dataset
收藏资源简介:
SheetSage-A2S数据集是由多所大学联合创建的首个面向流行音乐的音频到乐谱转录专用数据集,旨在填补该领域研究空白。该数据集包含9,468个音频片段,源自6,066首歌曲的2,891位艺术家,总时长约61小时,每个片段均配有**kern格式的乐谱编码。数据构建过程基于SheetSage注释和YouTube真实录音,通过八度推理和json转kern流程实现自动标注,确保了音频与乐谱的精准对齐。该数据集主要用于推动流行音乐转录研究,解决现有方法仅适用于古典音乐而缺乏真实录音数据的问题,为后续模型训练和基准测试提供了关键资源。
SheetSage-A2S dataset is the first dedicated audio-to-score transcription dataset for popular music, jointly created by multiple universities, aiming to fill the research gap in this field. This dataset contains 9,468 audio clips, originating from 6,066 songs by 2,891 artists, with a total duration of approximately 61 hours. Each clip is paired with **kern-format musical score encoding**. The data construction process is based on SheetSage annotations and real YouTube recordings, and achieves automatic annotation through octave inference and the json-to-kern workflow, ensuring precise alignment between audio and musical scores. This dataset is mainly used to advance research on popular music transcription, addressing the issue that existing methods only apply to classical music and lack real recording data, providing a critical resource for subsequent model training and benchmark testing.
SheetSage-A2S 数据集详情
数据集概述
SheetSage-A2S 是首个面向流行音乐的音频到乐谱(Audio-to-Score, A2S)数据集,包含 61 小时的真实商业发行音频,覆盖 6,066 首歌曲,每首歌曲配有对应的 Humdrum **kern 主旋律谱(lead-sheet)编码。与现有仅依赖西方古典音乐合成录音的 A2S 数据集不同,本数据集基于真实音频构建,并同时提供演唱旋律及其和弦信息。
数据集形式
数据集以两种形式发布,包含相同的歌曲及相同的训练/验证/测试划分:
| 数据集名称 | 内容 | 地址 |
|---|---|---|
| Sheetsage-A2S | kern 乐谱 + YouTube 链接和时间戳 | https://huggingface.co/datasets/MMR-Lab/Sheetsage-A2S |
| Sheetsage-A2S-MuQ | MuQ 预训练特征 + kern 乐谱 | https://huggingface.co/datasets/MMR-Lab/Sheetsage-A2S-MuQ |
数据获取
模型检查点
- 模型检查点公开可用于推理,托管于 Hugging Face Hub:https://huggingface.co/collections/MMR-Lab/sheetsage-a2s
- 如需从头训练模型或进行自定义实验,需在 Hugging Face Hub 填写简短的申请表以获取数据集访问权限
下载命令示例
bash
下载数据集
hf download MMR-Lab/<SheetSage-a2s-muq> --repo-type dataset --local-dir /path/to/data/SheetSage-a2s-muq
下载检查点
hf download MMR-Lab/<checkpoints> <name>.ckpt --local-dir weights/preprocessed_muq
模型与性能
论文提出了一种基于自回归 Transformer 解码器的 A2S 模型,核心改进包括:
- 更大的前馈网络维度(ff dim)
- 预归一化解码器(pre-norm decoder)
- 使用 MuQ 作为编码器替代 CNN
- 音高/速度数据增强
整体符号错误率(SER,越低越好)
| 方法 | SheetSage-A2S | Quartets |
|---|---|---|
| 基线 | 66.85 | 15.3 |
| + 1024 Pre-Norm | 53.7 | 8.48 |
| + MuQ 编码器 | 25.39 | 7.16 |
| + 增强数据 | 20.92 | 4.98 |
SheetSage-A2S 分项指标
| 变体 | 总体 SER | 旋律 SER | 和弦 SER | MV2H(越高越好) |
|---|---|---|---|---|
| 基线 | 66.85 | 106.88 | 64.12 | 70.39 |
| + 1024 Pre-Norm | 53.7 | 90.56 | 51.8 | 72.62 |
| + MuQ | 25.39 | 46.21 | 26.76 | 79.38 |
| + 增强 | 20.92 | 38.62 | 22.28 | 85.05 |
使用说明
环境要求
- Python 3.11+,CUDA 显卡
- 系统包:
ffmpeg、fluidsynth、rubberband-cli(仅增强时需要) - 支持 Docker 安装
编码器与分词器选项
- 编码器:
cnn、muq、preprocessed_muq - 分词器:
word、medium、original
主要命令
训练: bash python train.py --ds_location MMR-Lab/Sheetsage-A2S-MuQ --encoder preprocessed_muq --tokeniser word --batch_size 8 --learning_rate 5e-5 --weight_decay 1e-3 --ff_dim_multiplier 4 --label_smoothing 0.1 --patience 5
评估: bash python run_metrics.py --checkpoint_path MMR-Lab/Sheetsage-A2S-model --ds_location MMR-Lab/Sheetsage-A2S-MuQ --encoder preprocessed_muq --tokeniser word --dataset_type lead_sheet
推理/可视化: bash python sample.py --checkpoint_path MMR-Lab/Sheetsage-A2S-model --ds_location MMR-Lab/Sheetsage-A2S-MuQ --tokeniser word --number 5
许可与引用
- 代码基于 MIT 许可证 发布
- 论文引用信息:
- 标题:Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset
- 作者:Cummins, Eoin 等
- 发表于:ACMMM 2026,arXiv 预印本 arXiv:2608.06165
致谢与参考
- MuQ:预训练音乐音频编码器
- ISMIR-Jazzmus:kern 分词器代码来源
- a2s-transformer:参考代码
- 1Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset都柏林大学学院; 广西师范大学; 大湾区大学; 深圳大学 · 2026年




