遇见数据集

ASPED

收藏
arXiv2024-01-17 更新2024-07-29 收录
官方服务:

资源简介:

ASPED(Audio Sensing for PEdestrian Detection)是由佐治亚理工学院创建的大型音频数据集,专注于通过音频信号检测行人。该数据集包含约2,600小时的音频和3,406,229帧的视频数据,记录于校园内的多个地点。数据集的创建过程涉及使用高质量的音频和视频设备,确保数据的多样性和高质量。ASPED数据集的应用领域主要集中在智能城市设计和交通基础设施规划,旨在通过音频分析提高行人检测的准确性和效率,从而优化城市资源利用和服务交付。

ASPED (Audio Sensing for PEdestrian Detection) is a large-scale audio dataset created by the Georgia Institute of Technology, focusing on pedestrian detection via audio signals. This dataset contains approximately 2,600 hours of audio data and 3,406,229 frames of video data, recorded at multiple locations on campus. The development of the dataset utilized high-quality audio and video equipment to ensure data diversity and high quality. The main application areas of the ASPED dataset are smart city design and transportation infrastructure planning, aiming to enhance the accuracy and efficiency of pedestrian detection through audio analysis, thereby optimizing urban resource utilization and service delivery.

提供机构:
佐治亚理工学院
创建时间:
2023-09-13
搜集汇总
数据集介绍
ASPED 数据集图片
构建方式
在智慧城市与城市声景智能分析日益受到关注的背景下,ASPED数据集应运而生。该数据集由佐治亚理工学院研究团队在校园内多个独立录音会话中采集,部署了Tascam DR-05X录音设备与GoPro HERO9摄像机,分别以高采样率音频和1帧/秒延时摄影模式记录。录音设备被固定于约胸部高度,摄像机则架设于2.5米高处,确保视野覆盖所有录音点。通过吹哨与time.gov时间同步,实现音视频精确对齐。最终获得近2600小时音频与超过340万帧视频数据,覆盖两个步行区域的工作日时段。
特点
ASPED数据集以大规模、高质量与多样性为核心特色。其标注方式独具匠心:利用Mask2Former模型从视频帧中检测行人,并以录音杆为中心设置1米、3米、6米、9米四种半径的圆形缓冲区,统计各半径内行人数量,形成四套逐帧标签。数据分布高度不平衡,无行人帧占绝对主导,且行人活动在午间达到高峰。这种多半径标注策略使得研究者能够探索空间距离对检测性能的影响,同时为音频行人检测这一新兴任务提供了极具挑战性的基准。
使用方法
数据集的使用聚焦于二分类任务,即判断每帧音频中是否存在行人。研究者可将标签按不同行人数量阈值(如1、2、3、4)进行二值化,灵活调节任务难度。基线实验表明,采用卷积编码器结合Transformer(CONV)或音频频谱图Transformer(AST)模型,在3米和6米半径上表现较优。训练时建议采用加权批次采样与动态损失加权,以缓解类别不平衡。数据集已按80/10/10划分为训练、验证与测试集,并移除了重叠片段,可直接用于模型训练与评估。
背景与挑战
背景概述
城市声景的智能解析正成为智慧城市设计中的关键环节,麦克风凭借其低成本、低功耗、广覆盖及不受光照与天气影响的优势,正逐步补充甚至替代传统传感器。在此背景下,佐治亚理工学院CSPAV、音乐信息学小组与IPaT团队,联合多伦多都市大学,于2023年发布了ASPED数据集,旨在开辟城市声学分析的新任务——基于纯音频信号的行人检测。该数据集在佐治亚理工学院校园内多个地点、分多个时段采集,包含近2600小时的高质量音频与340万帧视频,并通过视频分析标注了不同半径内行人数量。ASPED的发布填补了现有音频数据集(如AudioSet、SONYC)在行人感知领域的空白,为智能交通规划、行人基础设施优化及城市可持续发展提供了关键数据支撑,其影响力已获美国国家科学基金会(NSF)资助认可。
当前挑战
ASPED数据集所面临的挑战兼具领域开创性与构建复杂性。在领域问题层面,行人检测的独特难点在于:行人产生的音频信号(如脚步声、谈话声)通常音量微弱且种类多样,需在包含车辆噪声等多声源重叠的复杂城市声景中实现精准识别,现有基于图像或视频的行人检测方法难以直接迁移。在数据集构建过程中,挑战尤为突出:首先,如何确定能明确标识行人运动的关键声音成分(是脚步声、衣物摩擦声还是对话声)缺乏先验知识;其次,数据采集需克服设备续航限制(每次约2天)、多设备时间同步(通过哨声与网络时间校准)以及天气防护等工程难题;最后,标注环节依赖Mask2Former模型自动检测行人,在低音量或远距离下易出现漏检,且数据呈现高度类别不平衡(无行人帧占绝大多数),给后续机器学习建模带来了严峻考验。
常用场景
经典使用场景
在智慧城市与城市声景智能分析的交叉领域中,ASPED数据集为基于纯音频信号的行人检测这一新兴任务提供了关键支撑。该数据集通过在多处校园区域部署高保真录音设备,同步采集视频用于标注,构建了包含近2600小时音频与340万帧视频的大规模资源。其经典使用场景聚焦于利用音频特征(如脚步声、谈话声等)在复杂城市声学环境中判别行人存在与否,尤其针对不同麦克风感知半径(1米至9米)下的二分类任务,为城市声学传感研究开辟了全新方向。
衍生相关工作
ASPED数据集的发布催生了一系列衍生研究工作。在方法层面,研究者借鉴其基线框架,探索了将预训练的VGGish嵌入与Transformer编码器结合,以及音频频谱图Transformer(AST)等先进架构在行人检测中的迁移能力。后续工作进一步拓展至多任务学习,将行人计数回归与存在性分类相统一,并引入对抗训练以增强对风噪、雨声等环境干扰的鲁棒性。此外,该数据集启发了跨模态融合研究,尝试将音频特征与稀疏视觉信号协同,构建更稳健的行人轨迹预测模型。这些工作共同推动了城市声学感知从事件检测向细粒度人群分析的范式演进。
数据集最近研究
最新研究方向
在城市声景智能分析领域,ASPED数据集开辟了基于纯音频信号进行行人检测这一前沿研究方向。该数据集突破了传统依赖视觉传感器的局限,利用麦克风低成本、低功耗、360度覆盖且不受光照与天气影响的优势,为智慧城市中的行人流量监测、基础设施规划及突发事件预警提供了全新听觉感知路径。当前研究热点集中于探索不同深度学习架构(如VGGish、卷积编码器与音频频谱变换器)在复杂城市噪声环境下对行人活动信号的分类效能,并系统考察录音半径、行人计数阈值等参数对检测性能的影响。这一工作不仅填补了声音事件检测领域缺乏行人标注数据集的空白,更推动了多模态感知与可持续城市交通管理的交叉融合,其成果有望优化资源配置、提升服务公平性,具有重要的学术价值与社会应用前景。
相关研究论文
  • 1
    ASPED: An Audio Dataset for Detecting Pedestrians佐治亚理工学院 · 2024年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务