遇见数据集

MulTTiPop

收藏
arXiv2026-07-10 更新2026-07-11 收录
数据链接:
官方服务:

资源简介:

MulTTiPop是由卡内基梅隆大学创建的流行音乐多轨转录数据集,旨在为自动音乐转录模型评估提供基准。该数据集包含572个音乐片段,总计3.5小时音频,源自1930年代至2000年代多样流派和年代的流行歌曲,数据来源于Lakh MIDI和TheoryTab数据集。其创建过程通过元数据匹配音频与MIDI文件,结合节拍追踪和人工锚定节拍选择,实现精确的时间对齐。该数据集主要应用于自动音乐转录领域,旨在解决商业流行音乐多轨转录评估数据缺乏的问题,推动模型在真实世界音乐场景中的性能提升。

MulTTiPop is a multi-track transcription dataset of popular music developed by Carnegie Mellon University, serving as a benchmark for evaluating automatic music transcription models. This dataset comprises 572 music clips totaling 3.5 hours of audio, sourced from pop songs across diverse genres and eras spanning the 1930s to the 2000s, and is derived from the Lakh MIDI and TheoryTab datasets. Its creation workflow matches audio and MIDI files via metadata, combined with beat tracking and manual anchor beat selection to achieve precise temporal alignment. Primarily applied in the field of automatic music transcription, this dataset aims to fill the gap in multi-track transcription evaluation data for commercial pop music, and to promote the performance enhancement of models in real-world music scenarios.

提供机构:
卡内基梅隆大学
创建时间:
2026-07-10
原始信息汇总

数据集概述:MulTTiPop

  • 全称:MulTTiPop: A Multitrack Transcription Dataset for Pop Music
  • 来源:音频片段源自 TheoryTab,对齐的多轨 MIDI 转录源自 Lakh MIDI 数据集。
  • 规模:包含 572 个片段,总数据时长约为 3.5 小时。
  • 内容:提供对齐的多轨 MIDI 文件及相关元数据文件(含 YouTube 视频 ID 和时间戳)。
  • 用途建议
    1. 仅获取原始音频的对应片段。
    2. 仅用于模型评估,不用于训练。
  • 数据集划分:按约 3:7 比例分为 devtest 两个子集,不提供训练或验证集。
  • 许可证:CC-BY 4.0。
  • 下载地址:https://huggingface.co/datasets/gclef-cmu/multtipop
  • 相关论文:https://arxiv.org/pdf/2607.08756
搜集汇总
数据集介绍
MulTTiPop 数据集图片
构建方式
MulTTiPop数据集的构建始于元数据匹配,通过计算Lakh MIDI数据集和TheoryTab数据集之间的歌曲标题与艺术家信息的Levenshtein距离,筛选出1164个潜在匹配项。随后,对音频片段进行基于RNN的节拍跟踪提取节拍,并以MIDI文件的节拍网格为基准,通过线性插值将MIDI音符的时间戳扭曲至与音频节拍对齐。最终,算法为每个匹配生成最多四个候选锚点节拍,并由六名音乐领域的人工标注者通过可视化界面选择最准确的对应节拍,确保转录与音频精确同步。
特点
该数据集包含572个流行音乐片段,总时长约3.5小时,涵盖从1930年代至2000年代的374首歌曲与263位艺术家,横跨摇滚、新浪潮、摩城等101种风格,其多样性显著超越同类数据集。每个片段平均22秒,提供多轨MIDI转录,包含平均583个音符,且音频来源于商业流行唱片,具有真实音色与高生态效度,避免了合成音频的局限性,是对自动音乐转录模型进行真实场景评估的理想基准。
使用方法
MulTTiPop严格设计为评估数据集,建议仅用于测试自动音乐转录模型,而非训练。研究人员应依据提供的YouTube视频ID和时间戳获取对应音频片段,并与多轨MIDI标签配对使用。数据集划分为开发集(169片段,61分钟)和测试集(403片段,152分钟),且按艺术家分层确保无重叠,避免数据泄露。评估时推荐采用50毫秒容差的Onset F1指标,并可在项目网站预览同步音频-可视化结果,以直观分析模型性能。
背景与挑战
背景概述
在自动音乐转录领域,从音频到符号化乐谱的转换技术近年来取得了显著进展,但针对多声部流行音乐的精准转录仍是一个极具挑战性的问题。2026年,卡内基梅隆大学的Nathan Pruyne、Benjamin Stoler及William Chen等研究人员推出了MulTTiPop数据集,旨在为多轨流行音乐转录模型的评估提供标准化基准。该数据集包含572个流行音乐片段,总时长约3.5小时,歌曲年代跨度从1930年代延伸至2000年代,涵盖101种音乐风格和263位艺术家,远超市面上现有流行音乐数据集(如RWC-Pop)的多样性。MulTTiPop的核心研究问题聚焦于弥合合成数据与商业录音之间的鸿沟——现有模型在合成数据上表现优异,但在真实商业流行音乐中转录效果大幅下降。通过提供精确对齐的多轨MIDI标签,该数据集为自动音乐转录领域树立了新的评估标杆,尤其推动了多乐器、多声部复杂场景下的模型性能评测。
当前挑战
MulTTiPop所解决的领域核心挑战在于商业流行音乐的多轨转录评估:现有自动音乐转录模型(如MT3和YourMT3+)在该数据集上的最佳起始点F1值仅为38%,远低于其在古典钢琴或合成数据上的表现,暴露出模型在处理真实录音中音色复杂、织体密集的流行音乐时的严重不足。构建过程中,研究者面临多重难题:首先,从Lakh MIDI数据集与TheoryTab的元数据匹配中,仅1164个潜在配对通过精确度筛选,最终只有49.1%的片段成功实现节拍对齐,其余因元数据错误或节奏失配被舍弃;其次,基于节拍跟踪的对齐算法在自动识别锚点节拍时可靠性低下,必须依赖人工标注——六名标注员在长达3至4小时/批次的标注中,需从最多四个候选对齐方案中选出最佳匹配,且嵌入隐藏验证集确保质量;此外,旋律匹配虽将成功率从2.3%提升至31.7%,但YouTube视频起始时间的引入反而在某些案例中因视频内容与MIDI结构不匹配而导致失败。
常用场景
经典使用场景
在自动音乐转录(AMT)领域,MulTTiPop被广泛用于评估多轨转录模型对商业流行音乐的性能表现。该数据集提供了572段时长约3.5小时的流行音乐片段,并配有精确时间对齐的多轨MIDI标注,涵盖从20世纪30年代至2000年代的多样风格与艺术家。研究者通常利用它将模型在真实商业录音上的表现与合成数据训练的结果进行对比,从而衡量模型在复杂纹理、真实音色和动态节奏环境下的泛化能力。MulTTiPop的经典使用场景是作为标准测试基准,专门用于评估MT3、YourMT3+等前沿AMT模型在全乐器多轨转录任务中的表现,揭示了现有模型在处理密集编曲、多声部一致性及音色多样性时的显著不足。
解决学术问题
MulTTiPop解决了AMT研究中长期缺乏高质量、时间对齐的多轨流行音乐转录评测数据集这一核心难题。此前,MAESTRO和MusicNet仅覆盖钢琴或古典音乐的单轨转录,Slakh2100使用合成音频导致音色与商业录音存在差异,而TheoryTab仅提供旋律与和弦标注。MulTTiPop通过创新的基于节拍对齐的元数据匹配与人工锚点标注方法,首次实现了商业录音与多轨MIDI的精准对齐,填补了真实场景多轨转录评估的空白。该数据集的出现使学术界能够系统量化模型在真实流行音乐上的性能瓶颈,例如最佳模型Onset F1仅达38%,证明当前AMT模型远未满足实用需求,从而推动后续研究从合成数据训练转向真实数据适应与多声部建模。
衍生相关工作
MulTTiPop的发布催生了多项突破性工作。其评测结果直接促使YourMT3+等模型在后续版本中引入跨数据集音源增强技术,以缩小合成与真实数据间的音色鸿沟。基于该数据集的定性分析发现,现有模型对主旋律跟踪尚可但和声连贯性差,由此启发了多任务学习与生成式预训练的结合,如Sheet Sage将Melody与和弦标注扩展为完整多轨转录。此外,MulTTiPop的节拍对齐方法论被继承至Sheet Sage等工作中,用于自动提取商业录音的节拍与和弦标签。该数据集还推动了半监督与无监督AMT范式的发展,研究者通过利用其对齐的多轨数据作为伪标签,结合大规模无标注音频进行自训练,显著提升了在密集编曲上的转录鲁棒性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务