VocalSketchDataSet
收藏资源简介:
该数据集包含数千个众包的语音模仿录音,这些录音模仿了大量多样化的声音,如日常声音和音乐概念,并附有众包人员正确标记这些语音模仿的数据。此数据集旨在帮助研究社区理解哪些音频概念可以通过这种方法有效传达,并支持构建利用语音模仿作为交互模式的系统。
This dataset comprises thousands of crowdsourced voice imitation recordings, which mimic a wide variety of sounds such as everyday noises and musical concepts, accompanied by accurately labeled data by the crowdworkers. The dataset is designed to assist the research community in understanding which audio concepts can be effectively communicated through this method and to support the development of systems that utilize voice imitation as an interactive mode.
数据集概述
本数据集包含数千个众包的语音模仿录音,涵盖多种声音,并附有众包参与者正确标记这些语音模仿的数据。该数据集旨在帮助研究社区理解哪些音频概念可以通过此方法有效传达,并支持构建利用语音模仿作为交互模式的系统。
数据集内容
-
语音模仿录音
- included: 符合纳入标准的语音模仿录音,用于分析。
- excluded: 不符合纳入标准的语音模仿录音,未用于分析。
- set2/included: 第二组符合标准的语音模仿录音。
- set2/excluded: 第二组不符合标准的语音模仿录音。
-
声音录音
- 包含参与者在进行语音模仿前听到的声音录音。
CSV文件描述
-
sound_recordings.csv
- id: 声音录音的标识符。
- sound_label: 与声音录音相关的标签。
- sound_label_id: 声音标签的标识符。
- filename: 声音录音的文件名。
- audio_concept_subset: 声音录音所属的音频概念子集。
-
sound_labels.csv
- id: 声音标签的标识符。
- label: 声音标签的文本描述。
- audio_concept_subset: 声音标签所属的音频概念子集。
-
vocal_imitations.csv 和 vocal_imitations_set2.csv
- id: 语音模仿的标识符。
- filename: 语音模仿的文件名。
- stimulus_type: 刺激类型(声音标签或声音录音)。
- included: 是否符合纳入标准。
- draft: 是否为草稿。
- training: 是否用于练习。
- participant_id: 参与者的标识符。
- satisfaction: 参与者对语音模仿的满意度。
- sound_label: 声音标签。
- sound_label_id: 声音标签的标识符。
- sound_recording: 声音录音。
- sound_recording_id: 声音录音的标识符。
- audio_concept_subset: 刺激所属的音频概念子集。
- participants_sound_recording_description: 参与者对声音录音的描述。
- participants_sound_recording_description_confidence: 参与者对描述的信心。
- description_match: 描述是否正确。
-
identifications.csv
- id: 识别的标识符。
- identification_type: 识别类型(声音标签或声音录音)。
- training: 是否用于练习。
- participant_id: 参与者的标识符。
- vocal_imitation_id: 语音模仿的标识符。
- sound_label: 参考音频概念的声音标签。
- sound_recording: 参考音频概念的声音录音文件名。
- sound_label_id: 声音标签的标识符。
- sound_recording_id: 声音录音的标识符。
- audio_concept_subset: 刺激概念所属的音频概念子集。
- vocal_imitation_filename: 语音模仿的音频文件名。
- participants_vocal_imitation_description: 参与者对语音模仿的描述。
- participants_vocal_imitation_description_confidence: 参与者对描述的信心。
- selection_sound_label: 参与者选择的强制选择识别任务的声音标签。
- selection_sound_label_id: 参与者选择的声音标签的标识符。
- selection_sound_recording: 参与者选择的强制选择识别任务的声音录音文件名。
- selection_sound_recording_id: 参与者选择的声音录音的标识符。
- selection_confidence: 参与者对强制选择的信心。
- selection_match: 强制选择是否正确。
- distractor0_id 至 distractor8_id: 干扰项的标识符。
- description_match: 描述是否正确。
-
participant_survey.csv 和 participant_survey_set2.csv
- participant_id: 参与者的标识符。
- age: 参与者的年龄。
- gender: 参与者的性别。
- hearing_problems: 参与者是否有听力问题。
- speech_problems: 参与者是否有言语问题。
- years_actively_using_music_tech: 参与者使用音频/音乐制作技术的年数。
- frequency_using_music_tech: 参与者使用音频/音乐制作技术的频率。
- years_actively_making_music: 参与者创作、练习或表演音乐的年数。
- frequency_making_music: 参与者创作、练习或表演音乐的频率。
- years_actively_singing: 参与者唱歌的年数。
- frequency_singing: 参与者唱歌的频率。
-
everyday_filename_translation.csv
- marcel_filename: Marcel数据集中的文件名。
- vocalsketch_filename: VocalSketch数据集中的文件名。




