遇见数据集

midisimx-samples

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

该数据集是midisimx项目的相似度搜索输出样本,包含约182,000+个经过加权midisimx音乐发现管道过滤的MIDI文件。数据源自Discover MIDI数据集。这些样本可用于MIDI音乐相似度搜索、分析和发现任务。数据集以ZIP压缩包形式提供,包含过滤后的MIDI文件。

This dataset is a similarity search output sample from the midisimx project, containing approximately 182,000+ MIDI files filtered through the weighted midisimx music discovery pipeline. The data originates from the Discover MIDI dataset. These samples can be used for MIDI music similarity search, analysis, and discovery tasks. The dataset is provided as a ZIP archive containing filtered MIDI files.

创建时间:
2026-08-16
原始信息汇总

midisimx 相似度搜索结果样本数据集

数据集概述

该数据集为 midisimx 音乐发现管道的相似度搜索输出样本,包含约 182,000+ 个 MIDI 文件,这些文件通过加权 midisimx 音乐发现管道筛选而来。数据集规模在 100万至1000万 条记录之间,使用 CC-BY-NC-SA-4.0 许可证,主要语言为英语。

数据集内容

  • 数据文件midisimx-similarity-search-output-samples-1-2-1-2-weighted-CC-BY-NC-SA.zip,包含约 182,000+ 个经过相似度筛选的 MIDI 文件。
  • 来源数据:基于 Discover MIDI Dataset 数据集,使用加权(1-2-1-2)嵌入方式生成,其中权重分配为:start-times 和 durations 权重为1,pitches 和 chords 权重为2。

相关资源

该数据集属于 midisimx 项目的一部分,项目包含:

资源类型 说明
预训练模型 midisimx_trained_model_14391_steps_0.255_loss_0.9036_acc.pth,在完整 Discover Piano 数据集上训练2个完整周期
预计算嵌入集 包含 Discover MIDI Dataset(3,267,574 个清理后 MIDI 的加权嵌入)和 LAKH MIDI Dataset(17,203 个清理后 MIDI 的加权嵌入)

midisimx 相对 midisim 的升级

  • 模型架构:采用统一的大型模型(替代原先两个较小的模型)
  • 模型维度:768(从512提升)
  • 模型深度:16层
  • 注意力头数:12头
  • 训练语料:300万+ 经过筛选和处理的 MIDI 文件(原为100万+原始 MIDI)
  • 事件表示:采用 start-time · note/chord · pitch · duration 格式
  • 代码质量:整体改进、扩展和现代化

MIDI 事件表示

midisimx 使用紧凑的事件结构令牌格式,每个事件按严格顺序编码:

  • Delta Start-Time(0-127):距上一事件的时间
  • Note/Chord Token(384-717):半音或和弦类别
  • Pitch(128-255):MIDI 音高
  • Duration(256-383):音符长度

单音符事件为4个令牌,和弦事件为 2 + (pitch, duration) × N 个令牌。

搜集汇总
数据集介绍
midisimx-samples 数据集图片
构建方式
midisimx-samples数据集是基于midisimx模型对大规模MIDI语料库进行相似性搜索后,筛选出的高质量输出样本集。其构建过程依托于一个统一的、大型的Transformer编码器模型,该模型在包含超过300万条经过滤与处理的MIDI文件上训练而成,训练数据主要来源于Discover MIDI Dataset和LAKH MIDI Dataset。模型采用一种紧凑的、事件结构的token表示,将起始时间、音符/和弦、音高和时长编码为有序的token序列,从而实现对音乐语义的精细刻画。在特征提取阶段,通过加权均值池化策略,对音高和和弦赋予更高的权重,生成能够突出音乐核心元素的嵌入向量。随后,利用余弦相似度计算,从庞大的嵌入语料库中检索出与查询MIDI高度相似的样本,并经过过滤与整理,最终形成包含约18.2万条MIDI文件的样本集。
特点
该数据集的核心特点在于其高质量与针对性。所有样本均由midisimx模型在3M+规模MIDI语料库上经过相似性筛选得出,确保了样本的音乐一致性与多样性。数据集采用权重视图(1-2-1-2)的嵌入表示,强化了音高与和弦在相似性判断中的作用,使得检索结果更侧重于旋律与和声的相似性。同时,数据集的规模(1M<n<10M)为大规模音乐信息检索研究提供了充足的数据支持。此外,该数据集与midisimx工具链紧密集成,支持快速的嵌入计算和相似性搜索,并附带了完整的代码示例,便于研究者复现与扩展。
使用方法
使用midisimx-samples数据集时,研究者可遵循midisimx库的标准工作流程。首先,通过`pip install -U midisimx`安装工具包,并下载预训练模型及对应的预计算嵌入文件。对于相似性搜索,用户需将目标MIDI文件转换为token序列,然后利用`get_embeddings_bf16`函数计算查询嵌入,并指定与训练时一致的`token_type_weights`参数以保持特征对齐。随后,通过`cosine_similarity_topk`在嵌入语料库中检索最相似的样本,最后可使用`copy_corpus_files`将匹配的MIDI文件复制至本地目录以供分析。此外,数据集也支持自定义嵌入语料库的生成,用户可依据提供的指南为自有MIDI集合构建嵌入,以满足特定研究需求。
背景与挑战
背景概述
midisimx-samples数据集由Project Los Angeles团队于2023年创建,旨在支持MIDI音乐相似性搜索与分析研究。该数据集源自庞大的Discover MIDI Dataset,经过midisimx模型(一个统一的大规模Transformer模型)的加权相似性搜索管道过滤,生成约18.2万个高质量MIDI文件。核心研究问题是提升MIDI音乐检索的准确性与效率,其影响力在于为音乐信息检索领域提供了一个大规模、精细标注的基准资源,推动了音乐生成、推荐系统及音乐学研究的进展。
当前挑战
该领域面临的挑战包括:第一,MIDI音乐结构的复杂性与多样性,使得相似性度量需同时考虑旋律、和声、节奏等多维度特征,传统方法难以全面捕捉;第二,大规模MIDI语料库的处理对计算资源与算法效率提出极高要求。构建过程中,挑战在于如何从海量MIDI数据中有效过滤噪声,确保样本质量,以及如何设计加权嵌入策略以准确反映音乐语义,同时平衡模型训练所需的巨大标注成本与时间开销。
常用场景
经典使用场景
midisimx-samples数据集汇聚了经由midisimx音乐发现管线精心筛选的逾18万首MIDI作品,其核心应用场景聚焦于大规模MIDI语料库的相似性检索与音乐信息挖掘。基于统一的大规模Transformer模型,该数据集支持将任意查询MIDI映射至高维语义嵌入空间,并通过余弦相似度计算实现高效、精准的乐曲匹配。在计算音乐学领域,研究人员可借此探索风格聚类、结构类比与音乐演变规律,为音乐生成、自动伴奏和翻唱识别等任务提供坚实的数据支撑。
衍生相关工作
基于midisimx-samples数据集,研究社区已衍生出多项代表性工作。其配套的midisimx模型与预计算嵌入集被广泛复用于构建更高效的MIDI检索管线,例如多模态音乐表征学习、基于Transformer的旋律生成预训练等。数据集所采用的事件编码方案亦启发了新一代符号音乐建模方法,相关研究在ISMIR、MIREX等国际会议上多有发表。同时,其开源的相似性搜索工具链促进了与Hummingbird、MusiCNN等模型的对比分析,形成了关于音乐嵌入空间特性的有益讨论,进一步巩固了该数据集作为MIR领域公共基准的地位。
数据集最近研究
最新研究方向
midisimx-samples数据集最新研究聚焦于大规模MIDI音乐检索与相似性分析的前沿探索,依托其统一的768维16层Transformer架构,结合3M+经细致清洗的MIDI语料进行预训练,显著提升了音乐语义表征的精度与效率。该数据集提供约18.2万条经加权过滤的相似性搜索结果样本,覆盖旋律、和声与节奏的细粒度匹配,为音乐推荐、版权溯源及创作灵感发现等应用奠定了坚实基础。同时,其创新的加权均值池化策略与兼顾音符、和弦的紧凑事件编码,推动了MIDI理解向更细腻、更本质的方向演进,在音乐科技与生成式AI领域具有重要影响意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务