遇见数据集

OSSQ-OMR

收藏
github2026-07-31 更新2026-08-20 收录
官方服务:

资源简介:

一个弦乐四重奏乐章乐谱的数据集,包含配对的合成和扫描图像以及多种符号音乐目标格式,并附带一个基准套件,用于评估几种光学音乐识别(OMR)架构(包括混合SMT/Zeus编码器-解码器系列和LEGATO基线)在转录这些乐谱上的表现,使用OMR-NED指标衡量。

A dataset of sheet music scores for string quartet movements, featuring paired synthetic and scanned images as well as multiple symbolic music target formats. It additionally provides a benchmark suite for assessing the performance of several optical music recognition (OMR) architectures—including the hybrid SMT/Zeus encoder-decoder series and the LEGATO baseline—when transcribing these sheet music scores, with performance measured using the OMR-NED metric.

创建时间:
2026-07-31
原始信息汇总

OSSQ-OMR 弦乐四重奏乐谱光学音乐识别数据集与基准

概述

该项目是一个针对弦乐四重奏乐谱的光学音乐识别(OMR)数据集与基准测试套件,相关论文发表于 ISMIR 2026。数据集名为 OSSQ-OMR,包含弦乐四重奏乐章乐谱的成对合成图像与扫描图像,并提供多种符号音乐目标格式,以及用于评估多种 OMR 架构的基准测试套件。

数据集构成

数据规模

  • 116 部弦乐四重奏作品,来自 47 位作曲家,编码为 122 个 MuseScore 文件(两部多乐章作品按乐章拆分),出版时间跨度为 1773 至 1994 年
  • 24,544 张系统图像98,172 张声部(分部)图像
    • 系统级:13,240 张合成 / 11,304 张扫描
    • 声部级:52,960 张合成 / 45,212 张扫描

图像类型

  • 合成(渲染)图像扫描图像 两类乐谱图片
  • 乐谱按 系统级(systemwise)声部级(partwise) 两种方式分割

符号转录目标格式

  • LMXE 系列:LMXE / PLMXE(分部)/ RLMXE(简化)
  • KRN 系列:KRN / EKRN
  • ABC 系列:ABC / EABC

资料来源

  • 93 部总谱、17 部分谱集、6 部手稿,涵盖 32 家出版商
  • 扫描轨道覆盖 93 部总谱
  • 数据基于 OpenScore String Quartets 语料库构建

数据划分

  • 数据划分在 乐谱级别 进行,防止跨划分泄漏
  • 提供 4 个随机划分,测试集互斥

基准测试

评估架构

  • SMT
  • Zeus
  • 混合 smt-zeuszeus-smt 编码器-解码器组合
  • LEGATO 基线模型

评估指标

  • OMR-NED(光学音乐识别归一化编辑距离)

组件仓库与许可

仓库 作用 许可证
ossq-omr 数据集仓库 — MuseScore/MusicXML 标注源及修订历史 CC0 1.0(数据)
omr-data-preprocessor 预处理流水线,从数据源构建所有派生符号格式 MIT
sqomr 模型训练与评估实验 MIT
lmxe LMXE 符号格式库(衍生自 OMR-Research/lmx MIT
LEGATO 基线(sqomr 子模块) 基线模型 MIT(其中 abc2xml.py 为 LGPL-3.0)

数据获取与使用

  • 仅需数据:通过 Zenodo(带版本和 DOI)或 Hugging Face 下载预构建数据集(目前均尚未发布)
  • 复现基准:递归克隆 sqomr 仓库,获取数据后按其 README 进行训练与评估
  • 从源头重建:克隆 ossq-omr 获取原始 MuseScore 标注历史,使用 omr-data-preprocessor 流水线完成格式转换、对齐、分割和渲染

引用

核心引用论文:Kim 等人,《A Dataset and Benchmark for Optical Music Recognition of String Quartet Scores》,ISMIR 2026。根据使用的组件不同,还需分别引用 LMXE/Zeus、OSSQ-OMR 数据集源、SMT 和 LEGATO 对应的学术论文。

搜集汇总
数据集介绍
OSSQ-OMR 数据集图片
构建方式
OSSQ-OMR数据集的构建源于对弦乐四重奏乐谱光学音乐识别(OMR)研究的迫切需求。其源头为OpenScore弦乐四重奏语料库,涵盖116部作品、47位作曲家,时间跨度从1773年至1994年,共编码为122个MuseScore文件。构建流程包括:从MuseScore注释历史中提取原始乐谱,经由omr-data-preprocessor流水线转换为多种符号音乐格式(如LMXE、KRN、ABC及其变体),并同步生成合成渲染图像与扫描图像。图像按系统级和声部级进行分割,最终形成24,544张系统图像与98,172张声部图像,涵盖93部总谱、17部分谱及6份手稿。数据集按乐谱级划分训练集、验证集与测试集,确保无跨集泄漏,并提供了四个随机划分版本。
特点
OSSQ-OMR数据集独具特色,为弦乐四重奏OMR提供了全面的基准。其核心优势在于图像多样性(合成与扫描并存)与符号标注的多元性(涵盖LMXE、KRN、ABC三类系列格式),满足了不同模型输入输出需求。数据集规模宏大,系统级与声部级图像总量逾12万张,支持端到端及模块化OMR方法。此外,它附带一套完整的基准测试框架,评估了包括SMT、Zeus、混合编解码器及LEGATO基线在内的多种前沿架构,统一采用OMR-NED指标,为研究者提供了横向比较的可靠依据。数据分割策略严格把关,防止信息泄漏,增强了评估的可信度。
使用方法
使用OSSQ-OMR数据集灵活多样。对于仅需数据的用户,可直接从Zenodo或Hugging Face下载预构建数据集,便于快速接入。欲复现基准实验者,应递归克隆sqomr仓库(内含LEGATO子模块),获取数据后严格遵循其README中的训练与评估指引。而有意从源头重建数据集的用户,可克隆ossq-omr仓库获取MuseScore历史,借助omr-data-preprocessor流水线逐步转换格式并渲染图像,过程中需依赖lmxe库。所有代码与数据均提供开源许可(数据CC0,代码MIT),并通过Zenodo获得DOI,确保可引用性与持久性。
背景与挑战
背景概述
OSSQ-OMR数据集诞生于光学音乐识别(OMR)领域对复杂乐谱(尤其是合奏乐谱)识别能力不足的背景下,由Dongmin Kim、Brian Liu、Jose J. Valero-Mas和Dasaem Jeong等研究人员于2026年构建,并在ISMIR 2026会议上发布。该数据集聚焦于弦乐四重奏乐谱,收录了116部作品、涵盖47位作曲家,时间跨度从1773年到1994年,提供了合成与扫描两种图像类型,以及多种符号音乐目标格式(如LMXE、KRN、ABC等),并配套了包含SMT、Zeus、混合架构及LEGATO基线的基准测试。该数据集的问世填补了OMR领域对多声部合奏乐谱识别研究的空白,为评估和推进端到端OMR模型提供了标准化平台,对音乐信息检索和数字音乐图书馆的发展具有重要影响力。
当前挑战
OSSQ-OMR数据集所面临的挑战主要体现在两个层面。在领域问题层面,弦乐四重奏乐谱的OMR需应对多声部同时进行、复杂节奏型、跨谱表连音线以及乐器间音符对齐等难题,这些均对现有模型的结构化感知和序列建模能力提出极高要求;同时,扫描图像的噪声、手写标记和版面畸变进一步加剧了识别难度。在构建过程中,数据集需从原始MuseScore注解历史中,通过定制化预处理流水线(omr-data-preprocessor)转换为多种符号格式,并确保系统级和声部级图像分割的精确性,以及合成与扫描图像间的一致性;此外,为规避数据泄漏,需在乐谱层面划分严格互斥的训练与测试集,这一过程涉及大量人工校验与格式兼容性处理,工作繁琐且易出错。
常用场景
经典使用场景
OSSQ-OMR数据集专为弦乐四重奏乐谱的光学音乐识别(OMR)研究而构建,其核心使用场景聚焦于乐谱图像到符号化音乐编码的端到端转录任务。该数据集提供成对的合成渲染图像与真实扫描图像,并配备系统级与分谱级两种切分方式,覆盖LMXE、KRN、ABC等多种符号音乐目标格式,为OMR模型在复杂合奏乐谱上的训练与评估提供了标准化基准。研究者可依托其严格划分的四个随机子集,在防止数据泄漏的前提下,系统性地对比不同架构(如SMT、Zeus及其混合体)的转录性能,从而推动OMR技术从单声部向多声部、从简单排版向真实扫描场景的跨越。
实际应用
在实际应用中,OSSQ-OMR可服务于音乐数字化典藏、乐谱自动排版与音乐信息检索等场景。图书馆及档案馆可利用基于该数据集训练的模型,将海量历史弦乐四重奏手稿与出版物自动转录为可编辑、可搜索的符号格式,大幅降低人工录入成本。在在线音乐教育平台,该技术能实现乐谱的即时解析与演奏辅助,增强用户互动体验。此外,其分谱与总谱的双重重构能力,为分区练习、自动伴奏生成等应用提供了技术支撑。通过与Hugging Face及Zenodo的集成,数据集的便捷获取与复现特性,加速了研究成果向工业级系统的转化,为音乐科技领域的实用工具开发奠定了数据根基。
衍生相关工作
该数据集的发布催生了多项衍生研究:其一,基于其LMXE格式库,研究者可探索更高效的乐谱线性化编码策略,如PLMXE与RLMXE,推动端到端OMR模型的序列建模能力提升;其二,其多格式符号目标(KRN、ABC等)为跨表示学习研究提供了新基准,衍生出关于不同编码间信息等价性与转换的探讨;其三,数据集对合成-扫描图像对的对比,激发了领域自适应与数据增强技术的研究,如对抗性域适应和图像去噪预处理;其四,所评估的混合架构(smt-zeus、zeus-smt)启发了多模态融合思路,后续工作或借鉴其编码器-解码器组合模式,扩展至其他乐器和复杂排版。此外,其与LEGATO基线的对比,亦推动了大模型在OMR任务上的应用探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务