遇见数据集

omr-voices

收藏
Hugging Face2026-08-14 更新2026-08-15 收录
官方服务:

资源简介:

KomaVision instrument voices 数据集是 KomaVision 应用程序用于演奏乐谱的采样乐器声音,取自 VSCO 2 Community Edition 的原始未修改文件。所有文件保持完整长度、立体声、原始位深和采样率,未经任何修剪、压缩、降混或重采样。数据集包含两种乐器:单簧管和小提琴。单簧管部分来自 Woodwinds/Clarinet/susLong 的中等力度层,共 11 个文件,总大小 20.2 MB;小提琴部分来自 Strings/Solo Violin/Arco Vib 的强力度层,共 15 个文件,总大小 35.4 MB。所有文件均提供 SHA-256 校验和以验证完整性。注意:单簧管的音高标签比实际音高低一个八度(例如标为 D2 实际为 D3),且文件 DCClar_susLong_F#5_v2_rr1_sum.wav 实际音高为 F6 而非 F#6,相差一个半音。数据集采用 CC0 1.0 许可,但建议致谢 Versilian Studios LLC / Sam Gossner。该数据集适用于音乐采样、声音合成、乐器库构建等任务。

The KomaVision instrument voices dataset is a collection of sampled instrument sounds used by the KomaVision application for playing musical scores, taken from the original unmodified files of VSCO 2 Community Edition. All files retain full length, stereo, original bit depth and sample rate, without any trimming, compression, downmixing, or resampling. The dataset contains two instruments: clarinet and violin. The clarinet part comes from the medium velocity layer of Woodwinds/Clarinet/susLong, with 11 files totaling 20.2 MB; the violin part comes from the strong velocity layer of Strings/Solo Violin/Arco Vib, with 15 files totaling 35.4 MB. All files are provided with SHA-256 checksums to verify integrity. Note: The pitch labels of the clarinet are one octave lower than the actual pitch (e.g., labeled D2 but actually D3), and the file DCClar_susLong_F#5_v2_rr1_sum.wav is actually F6 instead of F#6, a semitone difference. The dataset is licensed under CC0 1.0, but acknowledgment of Versilian Studios LLC / Sam Gossner is suggested. This dataset is suitable for tasks such as music sampling, sound synthesis, and instrument library construction.

创建时间:
2026-08-13
原始信息汇总

KomaVision instrument voices 数据集详情

基本信息

  • 数据集名称:KomaVision instrument voices
  • 许可协议:CC0 1.0(源自 VSCO-2-CE 仓库中的 CC0 1.0 法律文本)
  • 标签:audio、music、samples
  • 来源:KomaVision 应用运行时所使用的采样乐器文件,仅在用户选择特定乐器时由应用获取

数据内容

该数据集包含 26 个音频文件,均为 VSCO 2 Community Edition 原始文件,未经过任何修剪、压缩、混音降采样或重新调整电平,保留了完整长度、立体声、原始位深度和原始文件名。

文件夹 来源 文件数 大小
clarinet/ Woodwinds/Clarinet/susLong,v2(中)力度层 11 20.2 MB
violin/ Strings/Solo Violin/Arco Vibf 15 35.4 MB

重要注意事项

1. 音高标签与真实音高存在偏差

  • 单簧管:文件名中的音高标签比实际发声音高低一个八度(如 DCClar_susLong_D2_… 实际发声为 D3,146.7 Hz),所有 11 个文件一致如此。
  • 小提琴:文件名音高标签为标准科学音高,无需偏移。
  • 切勿直接依据文件名读取音高

2. 特定文件标注异常

  • 文件 DCClar_susLong_F#5_v2_rr1_sum.wav 实际发声为 F6(1397 Hz),而非文件名标注的 F#6,其在源头被错标了半音。但该文件本身音准正常,完全可用,且保留了原始文件名以维护来源可追溯性。
  • 应用内部使用测量频率而非解析文件名。

校验和

数据集中每个文件均提供了 SHA-256 校验和,用于验证文件与源版本的一致性。这些校验和由应用仓库中的 scripts/prepare_voices.py 脚本计算并核对。

许可与致谢

  • 尽管 CC0 不要求署名,但数据集仍对 Versilian Studios LLC / Sam Gossner 予以致谢(VSCO 2 CE 的 readme 有此要求)。
  • 当 VSCO 2 CE 的“条款”与 CC0 文件发生冲突时,以 CC0 为准——CC0 一旦适用即不可撤销。
  • 仅收录 Versilian 自己的单簧管和独奏小提琴录音,未包含 v1.1“legacy”/Ivy Audio 材料(其来源较为混杂)。
搜集汇总
数据集介绍
omr-voices 数据集图片
构建方式
本数据集源自KomaVision应用所采用的乐器采样音色,其构建过程严格遵循原始数据完整性原则。所有音频文件均直接取自VSCO 2 Community Edition,未经过任何修剪、压缩、降混、重采样或电平调整,保留了原始时长、立体声格式、位深度及文件名。构建流程中,通过脚本从源仓库复制文件,并利用SHA256哈希校验确保与源数据完全一致,从而保障了数据的真实性与可追溯性。数据集包含单簧管与独奏小提琴两类乐器,分别选取了特定的演奏技法与力度层,共计26个采样文件,涵盖多个音高,为音乐合成与音色研究提供了高质量的基础素材。
特点
该数据集的核心特点在于其纯净性与标注的细致入微。所有样本均为原汁原味的VSCO 2 CE文件,未做任何后期处理,确保了音色的自然质感与动态范围。尤为重要的是,数据集中揭示了两个关键的标注问题:单簧管的音高标签低于实际发音一个八度,以及特定文件(F#5)存在半音误标。这些发现不仅体现了数据集构建者对数据质量的严谨态度,也为使用者提供了重要的参考信息,避免因文件名误导而误用音高。此外,CC0 1.0许可证赋予了用户极大的使用自由度,而详细的校验和则进一步增强了数据的可信度。
使用方法
使用此数据集时,需特别注意其音高标注的特殊性。单簧管样本的文件名音高需上移一个八度方能对应实际发音,而小提琴样本的标注则与科学音高一致,无需调整。对于被标记为F#5实则发音为F6的样本,数据集中已明确指出其音高特性,用户可直接使用而无需修正。数据集设计初衷是供KomaVision应用在运行时动态加载,但因其采用CC0许可,亦可广泛用于音乐制作、声音合成研究或机器学习训练。使用时建议结合附带的校验和验证文件完整性,并参照实测频率信息进行音高解析,以充分发挥数据集的潜在价值。
背景与挑战
背景概述
随着数字音乐合成与交互式乐谱播放技术的蓬勃发展,对高质量、可复现的乐器采样音色需求日益凸显。KomaVision instrument voices(omr-voices)数据集应运而生,由KomaVision应用团队于2024年创建,旨在为其乐谱播放功能提供真实、纯净的管弦乐器音色。该数据集精选自VSCO 2 Community Edition,收录了单簧管与独奏小提琴的未处理原始采样,共计26个文件,涵盖多个音高与力度层,且以CC0 1.0协议发布,确保了音色资源的开放共享。其核心研究问题在于,如何在无需人工修剪或压缩的前提下,为计算乐谱识别(OMR)系统提供高保真的音频基准数据,从而推动音乐信息检索领域的实证研究。自发布以来,该数据集因其严苛的溯源验证与忠实于原始录音的特性,在音乐科技社群中获得了广泛认可,成为测试乐谱播放器音色还原度与音频分析算法的重要参考。
当前挑战
该数据集所面临的挑战多维且深刻。在领域问题层面,音乐信息检索(MIR)与光学乐谱识别(OMR)长期受困于音色标注不一致与音频样本稀缺的瓶颈,本数据集虽提供了纯净的采样,却仍需应对音高标签与实际发声之间存在的系统性偏差,例如单簧管音高标签整体低八度、个别文件(如F#5)存在半音错标,这要求使用者必须依赖实际测量频率而非文件名解析。在构建过程中,团队遭遇了版权与溯源的双重考验:源数据VSCO 2 CE虽声明CC0协议,但其README却附带额外条款,需在冲突时优先遵循法律上不可撤销的CC0,同时需谨慎剔除Ivy Audio遗留材料以确保来源纯净。此外,确保每个文件的SHA256校验哈希与源仓库完全一致,避免任何形式的数字信号处理,亦是技术实现上的一大挑战,最终通过脚本化复制与严格校验机制得以解决。
常用场景
经典使用场景
在音乐信息检索与乐器音色合成领域,该数据集为研究者提供了未经任何后期处理的原始录音样本,涵盖单簧管与独奏小提琴的多个音高与力度层次。其保留了原始位深、立体声格式及完整长度,为构建高保真音色库、训练神经音频合成模型及评估音色嵌入算法提供了纯净的基准数据。尤其适合用于乐器识别的跨库泛化实验、纯音高估计的校准研究,以及基于物理建模的声音合成系统的验证。
衍生相关工作
该数据集源自VSCO 2社区版的精选提取,其衍生影响体现在对原始开源项目的回馈与规范化。围绕它可发展出音高标签纠错算法、基于深度学习的乐器调音自动检测模型,以及针对错标样本的鲁棒性训练策略。其校验和与来源追踪机制启发了后续数据集发布时的质量管控流程,促进了社区对音频数据溯源重要性的认知,并可能催生更多基于CC0许可的高质量乐器采样子集。
数据集最近研究
最新研究方向
omr-voices数据集的发布,标志着音频采样领域对原始音源保真度与溯源透明性的极致追求,其源自VSCO 2 CE项目并采用CC0许可,为音乐生成、乐器识别及音色合成等研究提供了无版权负担的高质量样本。当前前沿方向聚焦于利用此类纯净采样进行神经音频合成与乐器音色建模,通过深度学习捕获器乐演奏的细微动态与声学特性,推动虚拟乐器与自动作曲系统的真实感提升。同时,对样本音高标注偏差的精确修正与元数据规范化,成为确保大规模音乐AI训练数据可靠性的关键议题,该数据集在此树立了严谨的校验范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务