遇见数据集

ALIGN_Dataset

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

ALIGN数据集是一个合成数据集,专为音乐对齐和错误检测任务设计。它包含12,000个程序化生成的Bb单簧管练习样本(output子集)和2,104个来自上传MusicXML乐谱的随机小节窗口样本(output_2k_rawdata子集)。每个样本由一份干净的MusicXML乐谱(verified_score.musicxml)和一份含有植错错误的演奏乐谱(performance_score.musicxml)组成,同时提供对应的音频文件(reference_audio.wav和performance_audio.wav)、MIDI文件、标签文件(labels.json)、对齐候选(candidates.json)、DTW对齐结果(alignment.npz)、对数梅尔频谱特征(performance_mel.npy和reference_mel.npy)以及元数据(metadata.json)。植错错误类型包括:错误音符(±1或±2半音或尖音)、遗漏音符(替换为休止符)、额外音符(分裂音符或插入邻音/尖音)、音准错误(1-4个音符上40-80分音分弯音)、节奏错误(延迟/提前起止、速度变化或时长不均)。每个样本包含1-8个非重叠的内容错误,并且通常会在错误后重复受影响的小节。音频为声音音高(移调-2),即书写C音实际发Bb音,但MusicXML和labels.json中的音高仍采用书写音高。标签遵循schema 1.2,包含连续的干净乐谱音符旋律(带两侧1-2个音符的填充)。数据集用于评估音乐对齐算法,官方评估指标为连续音高列表的包含F1,而非时间戳IoU。数据通过zip分片存储(每片250个样本),并附带manifest.json索引。

The ALIGN dataset is a synthetic dataset designed for music alignment and error detection tasks. It contains 12,000 programmatically generated Bb clarinet exercise samples (output subset) and 2,104 random bar window samples from uploaded MusicXML scores (output_2k_rawdata subset). Each sample consists of a clean MusicXML score (verified_score.musicxml) and a performance score with injected errors (performance_score.musicxml), along with corresponding audio files (reference_audio.wav and performance_audio.wav), MIDI files, label files (labels.json), alignment candidates (candidates.json), DTW alignment results (alignment.npz), log-mel spectrogram features (performance_mel.npy and reference_mel.npy), and metadata (metadata.json). Injection error types include: wrong notes (±1 or ±2 semitones or sharp), missing notes (replaced by rests), extra notes (split notes or inserted neighbor/sharp notes), intonation errors (40-80 cents pitch bend on 1-4 notes), and rhythm errors (delayed/early start/stop, tempo changes, or uneven durations). Each sample contains 1-8 non-overlapping content errors, and typically repeats the affected bars after the error. The audio is in sounding pitch (transposed -2), i.e., written C sounds as Bb, but MusicXML and labels.json use written pitch. Labels follow schema 1.2 and contain continuous clean score note melody (with 1-2 note padding on both sides). The dataset is used to evaluate music alignment algorithms, with the official evaluation metric being the inclusion F1 for continuous pitch lists, not timestamp IoU. Data is stored in zip shards (250 samples per shard) with a manifest.json index.

创建时间:
2026-09-06
原始信息汇总

ALIGN数据集总结

数据集基本信息

  • 数据集名称: ALIGN Dataset
  • 任务类型: 音频分类 (audio-classification)
  • 标签: 音乐、单簧管、MusicXML、音乐演奏、错误检测、合成数据、对齐
  • 样本规模: 10K < n < 100K
  • 数据集描述: 合成的降B调单簧管练习数据包,包含洁净的MusicXML乐谱和带有预设错误的SoundFont演奏音频。黄金标签为乐谱部分旋律(schema版本1.2),而非仅时间间隔标注。
  • 数据特性: 洁净乐谱保持正确,只有合成的演奏部分存在故意植入的错误。

数据划分

样本被打包为zip分片文件(每片250个片段),以保证Hub文件数量限制。

文件夹 样本数量 来源
output/part_XXXX.zip 12,000 程序化生成的原创单簧管乐谱
output_2k_rawdata/part_XXXX.zip 2,104 上传的RawData/Score MusicXML中的随机小节窗口

manifest.json文件列出了每个分片中包含的样本ID。

解压后每片段文件结构

每个片段对应一个独立目录(例如synth_gen_0042/),包含以下文件:

文件名称 作用
verified_score.musicxml 洁净版乐谱(地面真值)
performance_score.musicxml 有错误的(可能重复的)渲染源
reference_audio.wav 洁净乐谱的单簧管渲染音频
performance_audio.wav 含植入错误的单簧管渲染音频
reference_audio.mid / performance_audio.mid 发送至SoundFont的MIDI文件
labels.json 合成黄金标签(来源:synthetic,schema 1.2)
candidates.json 自动对齐候选
alignment.npz DTW对齐产物
performance_mel.npy / reference_mel.npy 对数梅尔特征(22.05 kHz,128 mels)
metadata.json 渲染设置、错误类型、随机种子

音频音高说明: 音频使用实际发声音高(sounding_transpose: -2),即书面C发声为降B。MusicXML和labels.json中的pitches字段保持书面音高。

植入错误类型

每个片段包含1至8个不重叠的内容错误,从五种权重相等的错误类型中选取,之后通常会对受影响的小节进行重复:

错误类型 演奏中的变化
wrong_note (错音) ±1或±2个半音,或尖锐声(MIDI C6–A7)
missed_note (漏音) 书面音符替换为休止符
extra_note (添音) 将音符拆分;插入邻音或尖锐声
intonation_error (音准错误) 在1-4个音符上使用40-80音分的弯音
rhythm_error (节奏错误) 开始或结束延迟/提前、速度变化、时值不均匀

小节重复说明: 重复通常发生在内容错误之后(通常情况),或作为发声小节的独立重播。在重复前插入0.2–1.0秒的静音间隔。重复段落拷贝的内容标签不作为黄金标准。

旋律黄金标签定义: 为连续的一段洁净乐谱音符(score_part + pitches),每侧附带1-2个音符的填充。

数据加载示例

python from huggingface_hub import hf_hub_download from zipfile import ZipFile from pathlib import Path import json

zip_path = hf_hub_download( repo_id="LapisLa2uli/ALIGN_Dataset", filename="output/part_0000.zip", repo_type="dataset", ) out = Path("align_samples") with ZipFile(zip_path) as zf: zf.extractall(out) sample = next(p for p in out.iterdir() if p.is_dir()) labels = json.loads((sample / "labels.json").read_text(encoding="utf-8")) print(sample.name, len(labels["labels"]))

其他注意事项

  • 渲染工具: 使用tinysoundfont + FreePats单簧管SoundFont;MIDI通过music21生成
  • 评估方式: ALIGN官方合成评估采用连续音高列表的包含度F1(containment F1),而非时间戳IoU
  • 上传说明: pipeline.log文件未包含在上传数据中(原因:含有本地机器路径)
搜集汇总
数据集介绍
ALIGN_Dataset 数据集图片
构建方式
ALIGN数据集是针对Bb单簧管练习场景精心构建的合成数据资源,旨在为音乐对齐与错误检测研究提供基准。其构建过程融合了程序化生成与真实乐谱采样两种路径:一方面,程序化生成12,000条原创单簧管乐谱;另一方面,从上传的RawData/Score MusicXML中随机截取小节窗口,形成2,104条样本。每条样本均配以干净的MusicXML乐谱与经由SoundFont渲染的含有人为植入错误的表演音频,并附带完整的标签与对齐信息。数据经压缩封装为ZIP分片,每片250条,便于HuggingFace Hub存储与下载。
特点
该数据集的核心特点在于其高度可控的合成错误机制。每段音频包含1至8个非重叠的内容错误,涵盖错音、漏音、加音、音高偏差及节奏偏差五种类型,且错误常伴随小节重复,模拟真实练习中的典型失误。所有音频均以实际音高呈现,而乐谱与标签保持书写音高,确保音高体系的准确性。此外,数据集提供丰富的配套文件,包括对齐候选、DTW对齐产物、Mel频谱特征等,支持多层次的分析任务。标签采用1.2版乐谱旋律模式,以连续音高序列为基准,强调内容级别的对齐评估。
使用方法
使用ALIGN数据集时,研究者可通过HuggingFace Hub下载ZIP分片,并解压至本地目录。每个采样文件夹包含完整的乐谱、音频、标签及特征文件,便于直接进行模型训练或评估。官方评估协议采用连续音高列表的包含F1分数,而非基于时间戳的IoU,突出了旋律内容对齐的重要性。用户可依据labels.json中的标注信息,结合performance_audio.wav与reference_audio.wav进行错误检测、音乐对齐等任务,并参照metadata.json中的渲染参数与错误种子重现实验。该数据集为音乐信息检索领域提供了标准化、可复现的基准测试环境。
背景与挑战
背景概述
ALIGN_Dataset由研究者LapisLa2uli于近期创建,旨在为音乐表演中的错误检测与乐谱对齐任务提供标准化评估基准。该数据集针对降B调单簧管演奏,通过程序化生成及真实MusicXML乐谱的随机小节窗口,合成包含1至8种非重叠错误的音频样本,并配以精确标注的乐谱级对齐标签。其核心研究问题在于弥合乐谱与演奏音频之间的语义鸿沟,为自动音乐评分、练习反馈及音乐信息检索领域提供细粒度的时序与内容对齐评估工具。数据集的发布填补了合成数据规模与真实标注精细度之间的空白,推动了音乐教育技术及计算音乐学的发展。
当前挑战
该数据集所应对的领域挑战在于音乐演奏错误检测与乐谱对齐的复杂性,即音频与乐谱间的标注差异(如书写音高与发声音高的移调)及时间戳对齐的模糊性,现有方法常因训练数据匮乏而鲁棒性不足。在构建过程中,挑战主要源于同步生成内容错误(如错音、漏音、节奏偏差)与乐谱副本的精确配对,以及采用DTW对齐与连续音高列表包含度F1评估策略来保证标签一致性。此外,数据以ZIP分片存储以规避Hub文件数量限制,同时需剔除含本地路径的pipeline.log文件,确保数据可复现性与隐私安全。
常用场景
经典使用场景
ALIGN_Dataset作为合成Bb单簧管练习数据集,其核心使用场景在于音乐信息检索与自动对齐领域,特别是音乐表演与乐谱之间的同步与错误检测。研究者和开发者可利用该数据集训练和评估音乐音频与符号乐谱(MusicXML)间的对齐算法,以及识别演奏中的人为错误类型(如错音、漏音、增音、音准偏差、节奏偏差),推动自动音乐评估系统的发展。
实际应用
在实际应用中,ALIGN_Dataset支持开发面向单簧管学习者的智能练习辅助工具,能实时反馈演奏错误、提供矫正建议。此外,其合成数据生成管线可被扩展至其他乐器,用于音乐教育软件、虚拟现实音乐互动、以及音乐内容检索系统中的查询与比对功能,提升音乐制作与表演质量的自动化监控能力。
衍生相关工作
该数据集衍生的相关工作包括基于深度学习技术的音乐-乐谱对齐模型优化,如利用DTW初始化与神经注意力机制的混合方法;以及多维度错误检测的联合学习框架,将音高、节奏、音色错误分类与定位进行统一建模。此外,其所采用的合成数据策略也推动了自监督预训练在音乐理解任务中的应用,并激发了针对真实录音的跨域迁移研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务