遇见数据集

Wearable SELD dataset

收藏
arXiv2022-02-17 更新2024-06-21 收录
官方服务:

资源简介:

Wearable SELD数据集是由早稻田大学和日本电信电话公司合作创建的,旨在通过穿戴设备实现声音事件定位与检测。该数据集包含24个麦克风记录的数据,这些麦克风被安装在头部和躯干模拟器上,模拟眼镜、耳机等穿戴设备。数据集创建过程中,使用了多种录音条件和环境,以模拟真实世界的声音场景。该数据集主要用于开发和评估穿戴式声音事件定位与检测系统,特别是在行人行走等动态环境中的应用。

Wearable SELD dataset was jointly created by Waseda University and Nippon Telegraph and Telephone (NTT) Corporation, aiming to achieve sound event localization and detection (SELD) via wearable devices. This dataset contains recordings from 24 microphones mounted on a head-and-torso simulator, which simulates wearable devices such as glasses and headphones. During the dataset development, various recording conditions and environments were adopted to simulate real-world acoustic scenes. This dataset is primarily used for developing and evaluating wearable sound event localization and detection systems, especially for applications in dynamic scenarios like pedestrian walking.

创建时间:
2022-02-17
搜集汇总
数据集介绍
Wearable SELD dataset 数据集图片
构建方式
在声事件定位与检测(SELD)领域,现有数据集多基于一阶环绕声格式,限制了可穿戴场景下的麦克风阵列设计灵活性。为突破这一瓶颈,研究者提出了Wearable SELD数据集,其构建过程独具匠心:在头部与躯干模拟器(HATS)上部署24个微型全向麦克风,并搭配眼镜、耳塞式耳机、头戴式耳机及颈挂式扬声器等日常穿戴配件。数据采集在消声室与可变混响室中进行,包含两种混响时间(0.12秒与0.41秒)及无混响条件,并通过扬声器在108个离散方位角(-20°、0°、20°仰角,10°步进)发射线性调频信号,记录各通道的冲激响应。最终,通过将纯净声事件录音与随机选取的冲激响应卷积,并叠加最多两个重叠事件,合成长度为一分钟、采样率为48kHz的音频样本,构建出包含消声、混响及混响加噪声三种版本的子数据集。
特点
该数据集的核心特点在于其模块化与可配置性,为可穿戴SELD研究提供了前所未有的实验灵活性。24个麦克风通道可任意组合,允许研究者自由探索不同麦克风配置对定位与检测性能的影响。数据集覆盖三种典型穿戴场景:耳塞式(12通道模拟耳挂式与入耳式耳机)、头戴式(12通道涵盖眼镜、头戴式耳机及颈挂式扬声器)以及对比用的一阶环绕声格式。每个子数据集均包含开发集(400个样本)与评估集(100个样本),并精心设计了事件重叠规则(半数样本含两个重叠事件),以模拟真实环境中的复杂声场景。此外,数据集还提供了消声、混响及混响加噪声三种声学条件,使得系统在噪声鲁棒性测试中具备完备的评估维度。
使用方法
使用该数据集时,研究者可基于SELDNet等标准深度神经网络架构进行模型训练与评估。输入特征通常采用幅度谱图与相位差(PD)的组合,其中相位差通过计算通道对间的相位差并施加相位包裹算子得到。由于数据集支持任意麦克风子集选择,用户可依据实验需求灵活配置通道组合(如仅选用耳前麦克风或对称排列的2对2结构)。训练过程中,建议采用Adam优化器(初始学习率0.001)与DCASE2019 Challenge Task3标准损失函数,并通过DOA误差、帧召回率、错误率及F值四个指标全面衡量模型性能。值得关注的是,该数据集还提供了240种预定义麦克风配置的实验结果,可作为基准参考,帮助研究者快速定位最优的麦克风布局策略。
背景与挑战
背景概述
在智能听觉感知领域,声音事件定位与检测(SELD)作为一项融合性任务,旨在同步识别声源类别及其空间方位,对于环境理解与智能系统构建具有基础性意义。传统SELD研究多依赖一阶声场(FOA)格式的球型麦克风阵列数据集,虽能有效提取空间信息,但固定的阵列几何结构限制了其在特定场景中的适用性。为拓展SELD在可穿戴设备中的应用,特别是面向行人行走时的环境感知需求,早稻田大学与日本NTT公司研究团队于2022年联合推出了Wearable SELD数据集。该数据集基于头部与躯干模拟器(HATS),在眼镜、耳机及头戴式耳机等日常穿戴配件上部署了24个麦克风,系统性地模拟了头周可穿戴设备的声学场景。通过提供多通道、多配置的脉冲响应数据,该数据集为开发便携式SELD系统奠定了关键基础,并推动了可穿戴声学感知研究的发展。
当前挑战
Wearable SELD数据集所面临的核心挑战体现在两个层面。在领域问题层面,传统SELD方法依赖FOA格式的球型阵列,难以适应可穿戴设备中麦克风阵列几何结构的多样性与非预设性,导致现有模型在头戴式、耳挂式等非标准配置下的定位与检测性能显著下降。在数据集构建层面,研究人员需克服多个技术难点:首先,如何在保持高空间分辨率的同时,在有限的头周区域内合理布局24个麦克风位置,以覆盖眼镜、耳机等不同穿戴形态;其次,如何通过头与躯干模拟器精确采集包含多方位角与俯仰角(−20°至20°)的脉冲响应,并模拟消声、混响及噪声等多种真实环境条件;最后,还需确保合成音频中最多两个重叠声源的自然混合,以逼近实际行走场景中的复杂声学环境。
常用场景
经典使用场景
Wearable SELD dataset 为可穿戴设备环境下的声音事件定位与检测(SELD)研究提供了关键数据支撑。该数据集基于头部与躯干模拟器(HATS)布置的24个麦克风,模拟日常佩戴的眼镜、耳塞、耳机等设备,采集了涵盖无回声、混响及加噪等多种声学场景的音频数据。研究者可借助此数据集,系统评估不同麦克风构型(如耳周麦克风数量与位置)对SELD性能的影响,为开发面向行人导航、智能助听等便携式应用的高效声学感知系统奠定实验基础。
衍生相关工作
基于Wearable SELD dataset,衍生了一系列探索可穿戴麦克风最优构型与深度学习结合的经典工作。例如,研究者利用SELDNet架构对比了240种4通道子集组合,揭示了耳后麦克风虽提升角度估计但会降低事件检测率的权衡关系,并推荐了前耳布局方案。后续工作进一步拓展了该数据集的应用,如结合相位差特征与卷积循环网络提升混响鲁棒性,或将其与FOA格式数据联合训练以增强跨场景泛化能力,推动了可穿戴声学感知领域的标准化评估与模型创新。
数据集最近研究
最新研究方向
在智能听觉感知与环境理解领域,可穿戴设备的声学感知能力正成为前沿热点。Wearable SELD数据集应运而生,其核心研究方向聚焦于利用头部周围的可穿戴麦克风阵列(如眼镜、耳机、颈挂式扬声器等)实现声音事件定位与检测(SELD)。该数据集突破了传统一阶环境立体声(FOA)格式的几何限制,首次系统性地探讨了日常佩戴设备上不同麦克风配置对SELD性能的影响,尤其揭示了耳后麦克风可能导致的检测退化现象。这一研究不仅推动了SELD技术向便携化、日常化应用场景(如行人导航辅助)的落地,也为未来设计更符合人体工学与声学性能的可穿戴听觉系统提供了关键数据基础与实验范式,具有重要的学术价值与现实意义。
相关研究论文
  • 1
    Wearable SELD dataset: Dataset for sound event localization and detection using wearable devices around head早稻田大学, 东京, 日本 日本电信电话公司, 东京, 日本 · 2022年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务