Fhrozen/dcase22_task3
收藏资源简介:
DCASE 2022 Task 3数据集,包括STARSS22数据集和合成的SELD混合数据,由Tampere大学和SONY公司共同收集。数据集包含多通道录音和时空注释,用于声音事件检测和定位任务。数据集的特点包括真实场景录音、多种录音格式(如第一阶Ambisonics和四面体麦克风阵列)、详细的注释过程和数据集的规格说明。数据集适用于训练和评估机器听觉模型,包括声音事件检测、声音源定位和联合声音事件定位与检测等任务。
The DCASE 2022 Task 3 dataset, which includes the STARSS22 dataset and synthetic SELD mixed data, was jointly collected by Tampere University and Sony Corporation. It contains multi-channel recordings and spatio-temporal annotations for sound event detection and localization tasks. The dataset features real-world scene recordings, multiple recording formats such as first-order Ambisonics and tetrahedral microphone arrays, detailed annotation procedures and dataset specification documents. It is applicable for training and evaluating machine audition models, covering tasks including sound event detection, sound source localization, and joint sound event localization and detection.
数据集概述
数据集名称
Sony-TAu Realistic Spatial Soundscapes 2022 (STARSS22)
数据集描述
概览
- 内容: 包含多通道声音场景录音,以及时间和空间上的显著事件标注。
- 收集地点: 芬兰坦佩雷大学(TAU)和日本索尼公司。
- 录音格式: 两种4通道空间录音格式,包括麦克风阵列(MIC)和一阶Ambisonics(FOA)。
- 用途: 用于DCASE 2022声音事件定位与检测任务的开发数据集。
录音细节
- 录音时间: 2021年9月至2022年2月。
- 录音设备: Eigenmike em32麦克风阵列和Ricoh Theta V 360°视频录制。
- 跟踪系统: Optitrack Flex 13光学跟踪系统。
- 录音时长: 70个SONY录音片段(约2小时)和51个TAU录音片段(约3小时)。
数据集规格
- 录音数量: 111个录音片段。
- 房间数量: 11个独特房间。
- 采样率: 24kHz。
- 录音格式: 两种4通道3维录音格式。
- 目标声音事件类别: 13类。
声音事件类别
- 类别数量: 13类。
- 类别详情: 包括女性讲话、男性讲话、鼓掌、电话铃声、笑声等。
命名约定
- 文件命名:
fold[fold number]_room[room number]_mix[recording number per room].wav。
任务设置
- 训练与测试分割: 提供预定义的训练-测试分割。
- 评估: 模型应在训练分割上训练,在测试分割上报告结果。
文件结构
- 数据集根目录: 包含README.md、LICENSE文件。
- 子目录:
foa_dev和mic_dev,分别存储Ambisonic格式和麦克风阵列格式的录音文件。
数据集使用
- 适用任务: 声音事件检测(SED)、声音源定位、声音事件定位与检测(SELD)等。
- 使用指南: 遵循DCASE 2022挑战的指导,使用提供的训练-测试分割进行模型训练和评估。




