DCASE2025 Task3 Stereo SELD Dataset
收藏资源简介:
DCASE2025 Task3 Stereo SELD数据集是从STARSS23数据集中提取的立体声音频和透视视频数据。STARSS23包含多通道音频(例如FOA)和360°视频录制,以及目标事件类的时空注释。该数据集已被转换为立体声音频和透视视频数据,以模拟常规媒体内容。数据集分为开发集和评估集,分别包含30000个5秒长度的音频视频片段和10000个5秒长度的音频视频片段,总计55.6小时。该数据集旨在解决声音事件定位和检测(SELD)问题,并包含13个事件类别,如语音、电话和水龙头。立体声音频格式具有24 kHz的采样率,视频分辨率为640:360像素,水平视角为100°,帧率为29.97 fps。该数据集适用于音频增强、摄像头自动对准等音频视觉处理领域。
The DCASE2025 Task 3 Stereo Sound Event Localization and Detection (SELD) Dataset is extracted from the STARSS23 dataset, which contains multi-channel audio (e.g., FOA), 360° video recordings, and spatio-temporal annotations for target event classes. This dataset has been converted into stereo audio and perspective video formats to simulate conventional media content. It is divided into a development set and an evaluation set, with the development set containing 30,000 5-second audio-visual clips and the evaluation set including 10,000 such clips, resulting in a total duration of 55.6 hours. This dataset aims to address the task of sound event localization and detection (SELD), and covers 13 event categories such as speech, telephone, and faucet. The stereo audio has a sampling rate of 24 kHz, while the video has a resolution of 640×360 pixels, a horizontal field of view of 100°, and a frame rate of 29.97 fps. This dataset is applicable to audio-visual processing fields such as audio enhancement and automatic camera alignment.
DCASE2025 Task3 Stereo SELD Dataset 概述
基本信息
- 发布日期: 2025年6月1日
- 版本: 1.1.0
- 访问权限: 开放数据集
- DOI: 10.5281/zenodo.15559774
- 许可证: MIT License
创建者
- Shimada, Kazuki (Sony AI)
- Politis, Archontis (Tampere University)
- Roman, Iran R. (Queen Mary University of London)
- Sudarsanam, Parthasaarathy (Tampere University)
- Díaz-Guerra Aparicio, David (Tampere University)
- Pandey, Ruchi (Tampere University)
- Uchida, Kengo (Sony AI)
- Koyama, Yuichiro (Sony Group Corporation)
- Takahashi, Naoya (Sony AI)
- Shibuya, Takashi (Sony AI)
- Takahashi, Shusuke (Sony Group Corporation)
- Virtanen, Tuomas (Tampere University)
- Mitsufuji, Yuki (Sony AI, Sony Group Corporation)
数据集描述
- 来源: 基于STARSS23数据集,转换其第一阶Ambisonics (FOA)音频和360°视频数据为立体声音频和透视视频。
- 目的: 用于DCASE2025挑战赛的声音事件定位与检测 (SELD) 任务。
- 转换过程:
- 从STARSS23数据集中随机采样5秒片段。
- 将FOA音频转换为立体声音频,模拟中侧 (M/S) 录音技术。
- 将360°视频转换为固定视角的透视视频(水平视场100度,分辨率640x360)。
- 调整方向到达 (DOA) 标签以匹配新视角,忽略仰角标签,保留距离标签。
数据集规格
- 音频:
- 采样率: 24kHz
- 位深度: 16位
- 格式: 立体声 (M/S技术)
- 视频:
- 格式: 透视视频
- 分辨率: 640x360
- 帧率: 29.97 fps
- 数据量:
- 开发集: 30,000个5秒片段(41.7小时)
- 评估集: 10,000个5秒片段(13.9小时)
- 数据分布:
- 开发集: 23.9%来自东京,76.1%来自坦佩雷
- 评估集: 来自东京和坦佩雷的混合
声音事件类别
共13个目标声音事件类别:
- 女性语音
- 男性语音
- 拍手
- 电话
- 笑声
- 家庭声音
- 脚步声
- 门开关声
- 音乐
- 乐器
- 水龙头
- 铃声
- 敲门声
文件命名规则
- 开发集音频文件:
fold[fold number]_room[room number]_mix[recording number per room]_deg[viewing angle in degree]_start[start time in frame].wav - 评估集音频文件:
sample[clip number].wav
下载内容
- 开发集:
stereo_dev.zip: 立体声音频数据video_dev.zip: 透视视频数据metadata_dev.zip: 元数据
- 评估集:
stereo_eval.zip: 立体声音频数据video_eval.zip: 透视视频数据
相关资源
引用
Shimada, K., et al. (2025). DCASE2025 Task3 Stereo SELD Dataset (1.1.0) [Data set]. Zenodo. https://doi.org/10.5281/zenodo.15559774

- 1Stereo Sound Event Localization and Detection with Onscreen/offscreen Classification索尼人工智能 · 2025年



