遇见数据集

The CP-WTC Dataset

收藏
github2026-08-03 更新2026-08-22 收录
官方服务:

资源简介:

CP-WTC数据集提供了巴赫《平均律钢琴曲集》第一册录音片段的价值-唤醒度注释。

The CP-WTC Dataset provides valence-arousal annotations for audio excerpts from Bach's *The Well-Tempered Clavier, Book 1*.

创建时间:
2026-07-30
原始信息汇总

CP-WTC数据集概述

数据集简介

CP-WTC数据集提供了J.S.巴赫《十二平均律曲集(WTC)第一册》中48首作品(24首前奏曲与24首赋格曲)的效价-唤醒度(valence-arousal)标注,由六位著名钢琴家演奏。每首录音选取前八小节进行标注,每位听众对每个片段进行评价,每个片段获得22至29个标注,最终通过最小协方差行列式(MCD)估计器去除异常值后计算稳健均值。数据集共计包含288个标注音频片段(48首曲目×6位演奏者)及7,652条独立听众标注

演奏者信息

数据集中包含以下六位钢琴家的录音,括号内为数据集使用的缩写( pianist_id ):

  • 格伦·古尔德(GG)
  • 弗里德里希·古尔达(FG)
  • 安吉拉·休伊特(AH)
  • 斯维亚托斯拉夫·里赫特(SR)
  • 安德拉斯·席夫(AS)
  • 罗莎琳·图雷克(RT)

标注详情

  • 标注人员:约翰内斯·开普勒大学的计算机科学/人工智能学生,无特定音乐背景
  • 标注范围:每首录音的前八小节
  • 唤醒度(Arousal) :0~100,以10为步长,共11个等级
  • 效价(Valence) :-5~+5,以1为步长,共11个等级
  • 原始录音因版权限制不包含在数据集中,但提供了原始录音的参考信息

数据集结构

元数据

  • 录音详细信息(./metadata/recording_details.txt
  • 标注过程描述(./metadata/annotation_descriptions.pdf
  • 片段时间戳(./metadata/excerpt_timestamps.txt
  • 元数据与效价-唤醒度标注(./metadata/metadata_annotations.csv
  • 音频特征元数据(./metadata/metadata_audio_features.csv

音频特征

  • 低级/中级特征./features/lowlevel./features/midlevel):基于Essentia和Librosa提取,以10秒片段为单位;中等级特征基于特定模型进行领域自适应预测
  • BPM特征./features/bpm):librosa提取的每分钟节拍数
  • 梅尔频谱图./features/snippets_melspec):每个片段的对应梅尔频谱图

符号资源

  • 乐谱./symbolic/scores):48首作品的MusicXML乐谱,经人工审查校正,与Henle Verlag Urtext版本一致
  • 对齐文件./symbolic/alignments):每位演奏者音频到乐谱的自动对齐
  • MIDI./symbolic/alignments):由Transkun模型转写的演奏MIDI数据(注:为当前SOTA模型的转写结果,并非直接录制的真实数据)

引用信息

使用该数据集需引用以下论文:

  • Chowdhury & Widmer (2021),发表于ISMIR 2021
  • Ching & Widmer (2026),发表于ISMIR 2026

许可协议

数据集采用**知识共享署名-非商业性使用-相同方式共享4.0国际版(CC BY-NC-SA 4.0)**许可,仅供研究使用,禁止商业用途。

致谢

该工作受欧洲研究委员会(ERC)Horizon 2020研究与创新计划(资助协议号670035 “Con Espressione”和101019375 “Whither Music?”)及上奥地利州(LIT AI Lab)资助。

搜集汇总
数据集介绍
The CP-WTC Dataset 数据集图片
构建方式
CP-WTC数据集是围绕巴赫《平均律钢琴曲集》第一册中48首作品(含前奏曲与赋格)构建的感知情绪标注资源。为保障与既有研究的一致性,仅选取每首录音的前八小节作为标注片段,由多名无特定音乐背景的听者依据效价与唤醒度二维模型进行主观评定,每个片段获得22至29条原始标注。随后采用最小协方差行列式估计剔除异常值,计算稳健均值,最终形成涵盖6位著名钢琴家演绎的288个音频片段及7,652条个体标注的规模。由于版权限制,数据集不直接提供原始音频,而是配以丰富的特征提取文件、乐谱、对齐信息及MIDI转写,构建方式兼顾了学术规范与实用性。
特点
该数据集的核心特点在于其多维度的数据整合与精细化的标注体系。它提供了基于Essentia、Librosa等工具提取的低级音频特征、反映音乐表现力的中级感知特征、节拍速度数据及梅尔频谱图,同时包含经人工校订的乐谱、自动演奏对齐及采用先进模型转写的MIDI文件,为研究者提供了从声学信号到符号乐谱的全链路分析基础。标注方面,数据集不仅公开了稳健聚合后的效价与唤醒度数值,还保留了每位受试者的原始评分,这种透明性支持了后续对标注者间差异性的探索。此外,数据集的构建特别关注了与先前研究(如Battcock & Schutz)的兼容性,体现了其在相关领域中的延续性与可比性。
使用方法
使用者可依据所附的元数据文件(如`metadata_annotations.csv`)直接获取各录音片段的效价与唤醒度标注及其原始数据,便于开展情绪识别或演奏风格分析。对于需要音频内容的研究,数据集中提供了多种预提取的特征(存于`features/`目录),并以10秒为单位的“片段”形式组织,便于与标注时间对齐。同时,`utils/recreate.py`脚本支持利用原始录音自行构建标注片段,而`symbolic/`目录下的乐谱、对齐和MIDI数据则为多模态研究提供了便利。研究者可结合这些资源,灵活设计实验,以探究演奏中的情绪表达机制。
背景与挑战
背景概述
CP-WTC数据集由Johannes Kepler University的Shreyan Chowdhury与Gerhard Widmer等人于2021年创建,旨在探究古典钢琴演奏中情感表达的量化机制。该数据集以巴赫《平均律钢琴曲集》第一卷的48首曲目为素材,选取六位著名钢琴家的演绎版本,截取每首曲目的前八小节作为刺激材料,通过多位听者进行效价与唤醒度评分,并采用最小协方差行列式估计剔除异常值,最终形成288个带注释的音频片段及7652条个体标注。数据集的构建不仅为音乐情感计算研究提供了标准化资源,也促进了演奏风格比较、情感预测模型等方向的发展,对音乐信息检索领域具有重要影响力。
当前挑战
CP-WTC数据集面临多重挑战。在领域问题层面,音乐情感感知具有主观性与多维度性,不同听者对同一演奏的情感体验存在显著差异,如何从连续、多维的效价-唤醒度标注中提取稳定的情感表征是一大难题;同时,演奏中的情感传达依赖于力度、速度、音色等细腻变化,这些微妙差异难以通过传统声学特征全面捕捉。在构建过程中,原始音频受版权限制无法直接发布,仅提供提取的特征数据,这限制了研究者对原始信号的处理与验证;注释工作依赖于无音乐背景的学生,可能引入非专业偏差;此外,标注仅覆盖每首曲目的前八小节,难以反映完整演奏的情感动态,且不同钢琴家的演奏时值差异导致片段对齐与特征提取的复杂性,进一步增加了数据利用的难度。
常用场景
经典使用场景
CP-WTC数据集在音乐情感计算领域占据独特地位,其核心应用场景聚焦于感知情感(valence-arousal)的量化建模。该数据集精选巴赫《平均律钢琴曲集》第一册中48首作品,由六位著名钢琴家演奏,并依据Battcock与Schutz的标注策略,仅截取每首作品前八小节作为情感标注片段,确保了与既有研究的可比性。每个片段汇集22至29名听众的标注,经由最小协方差行列式估计器稳健处理后,获得288段音频的效价与唤醒度均值,为研究不同演奏诠释中的情感传递差异提供了精细化的数据底座。
实际应用
在实际应用层面,CP-WTC数据集为音乐推荐系统、智能陪练软件与情感化音乐生成工具的开发提供了直接支持。例如,基于该数据集训练的情感预测模型,可依据演奏特征实时评估表演的情感强度,从而在音乐教育中辅助学生优化表达方式。此外,其提供的特征集(包括低层音频特征与中层次感知特征)兼容性强,便于集成至数字音频工作站或流媒体平台,实现基于情感标签的乐曲自动分类与歌单生成,提升了用户聆听体验的个性化和情感匹配度。
衍生相关工作
基于CP-WTC数据集,衍生出多项开创性研究。Chowdhury与Widmer在2021年ISMIR会议上首次提出该数据集,并验证了中层次感知特征在预测感知情感中的重要性,为后续工作奠定了方法论基础。此后,Ching与Widmer于2026年发表论文,探索如何学习预测演奏诱发的情感差异,进一步提升了模型对细微表达变化的敏感度。此外,Chowdhury在其博士论文中系统化构建了基于可解释感知特征的情感表达模型,并拓展到情感可视化领域,展示了该数据集在音乐情感解码与交互式可视化方面的应用潜力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务