MusiXQA
收藏资源简介:
MusiXQA是一个多模态数据集,用于评估和训练音乐乐谱理解系统。每个数据样本包括:一个由MusiXTEX渲染的音乐乐谱图像(.png)、其对应的MIDI文件(.mid)、结构化注释(来自metadata.json)以及针对音乐结构、语义和光学音乐识别(OMR)的问题-答案对。
MusiXQA is a multimodal dataset designed for evaluating and training music score understanding systems. Each dataset sample includes a music score image (.png) rendered by MusiXTEX, the corresponding MIDI file (.mid), structured annotations from metadata., and question-answer pairs related to music structure, semantics, and optical music recognition (OMR).
MusiXQA数据集概述
数据集基本信息
- 名称:MusiXQA
- 类型:多模态数据集(音乐乐谱图像与MIDI文件)
- 用途:用于评估和训练音乐乐谱理解系统
- 规模:大规模数据集
- 主要特点:
- 专为音乐理解中的视觉问答(VQA)设计
- 包含针对音乐结构、语义和光学音乐识别(OMR)的问答对
数据组成
每个数据样本包含:
- 音乐乐谱图像(
.png格式,由MusiXTEX渲染生成) - 对应的MIDI文件(
.mid格式) - 结构化注释(来自
metadata.json) - 针对音乐结构、语义和光学音乐识别的问答对
相关资源
- 论文:arXiv:2506.23009
- 数据集地址:Hugging Face
- 预训练模型:Phi-3-MusiX
技术支持
- 音乐排版系统:MusiXTEX
- 音频生成工具:
- fluidsynth
- ffmpeg
数据合成
通过运行generate_musicsheet.py脚本可生成:
- 配置文件(
config.yaml) - 真实音乐数据(
.json) - PDF文档(
.pdf) - 页面图像(
.png) - MIDI文件(
.mdi) - 音频文件(
.mp3)
引用格式
bibtex @article{chen2025musixqa, title={MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models}, author={Chen, Jian and Ma, Wenye and Liu, Penghang and Wang, Wei and Song, Tengwei and Li, Ming and Wang, Chenguang and Zhang, Ruiyi and Chen, Changyou}, journal={arXiv preprint arXiv:2506.23009}, year={2025} }



