遇见数据集

Event-Shifted Acoustic Scene (ESAS) Dataset

收藏
Zenodo2026-06-06 更新2026-06-12 收录
官方服务:

资源简介:

The ESAS dataset is a new benchmark for evaluating the robustness of Acoustic Scene Classification (ASC) systems against unknown foreground sound events in real-world environments. Overview Existing ASC datasets mostly use clean background recordings. However, real-world scenes are often disrupted by unexpected sound events (alarms, voices, traffic, etc.). ESAS simulates this variability by injecting foreground events from FSD50K into background scenes from CochlScene, with semantic consistency ensured by Large Language Models (LLM). Key Features 13 scene classes, 96 event classes (27 known + 69 unknown) 76,115 clips (~211 hours of audio) Mix types: Background Only, Known Events, Unknown Events Rich metadata: SNR (-15~+15 dB), timestamps, event counts, etc. Unknown events appear only in the test set Construction Background scenes come from CochlScene. Foreground events are filtered and mixed using randomized overlapping, time-stretching, pitch-shifting, and SNR control. Benchmark State-of-the-art ASC models suffer significant performance drops when encountering unknown events, highlighting the need for event-robust methods. Resources Paper: Towards Event-Robust Acoustic Scene Classification (Interspeech 2026) Code & Generation Pipeline: GitHub Repository

ESAS数据集是一款用于评估声学场景分类(Acoustic Scene Classification,ASC)系统在真实场景中抵御未知前景声事件鲁棒性的新型基准测试数据集。 概述 现有ASC数据集大多采用纯净背景录音,但真实场景常被意外声事件(警报、人声、交通声响等)干扰。ESAS通过将FSD50K中的前景声事件融合至CochlScene的背景场景中来模拟此类多变性,并借助大语言模型(Large Language Models,LLM)保障语义一致性。 核心特性 1. 涵盖13种场景类别与96种事件类别(27种已知类别 + 69种未知类别) 2. 总计76115条音频片段,时长约211小时 3. 音频混合类型:仅背景、已知事件、未知事件 4. 附带丰富元数据:信噪比(Signal-to-Noise Ratio,SNR,范围为-15~+15 dB)、时间戳、事件数量等 5. 未知事件仅在测试集中出现 数据集构建 背景场景取自CochlScene数据集。前景声事件经过筛选后,通过随机叠加、时长拉伸、音调偏移以及信噪比调控等方式与背景进行混合。 基准测试结果 当前最先进的ASC模型在遭遇未知事件时会出现显著的性能下滑,这凸显了研发具备声事件鲁棒性方法的必要性。 资源获取 相关论文:《面向声事件鲁棒性的声学场景分类》(Interspeech 2026) 代码与生成流程:GitHub仓库

提供机构:
Zenodo
创建时间:
2026-06-06
二维码
社区交流群
二维码
科研交流群
商业服务