遇见数据集

Subtitle-Aligned Movie Sounds (SAM-S)

收藏
arXiv2023-02-15 更新2024-06-21 收录
官方服务:

资源简介:

Subtitle-Aligned Movie Sounds (SAM-S)数据集由南加州大学信号分析与解释实验室创建,包含从430部电影中自动提取的超过11万条音频事件数据。该数据集利用公开可用的闭路字幕转录,通过自动化方法挖掘音频事件,并根据声音、来源和质量三个维度进行分类,最终形成包含245种声音的分类体系。创建过程中,研究团队采用了简单且可扩展的方法,确保了数据集的高精度和低人工干预。SAM-S数据集主要应用于音频事件检测领域,旨在提高音频识别的准确性和效率,特别是在电影等多媒体内容中的应用。

Subtitle-Aligned Movie Sounds (SAM-S) dataset was created by the Signal Analysis and Interpretation Laboratory of the University of Southern California. It contains over 110,000 audio event entries automatically extracted from 430 movies. Leveraging publicly available closed-caption transcripts, the dataset extracts audio events via automated methods, and classifies them along three dimensions: sound type, source, and quality, ultimately establishing a taxonomy consisting of 245 sound categories. During the dataset creation process, the research team adopted a simple yet scalable approach, ensuring high accuracy and minimal human intervention. The SAM-S dataset is primarily applied in the field of audio event detection, aiming to improve the accuracy and efficiency of audio recognition, especially for multimedia content such as movies.

提供机构:
南加州大学
创建时间:
2023-02-15
搜集汇总
数据集介绍
Subtitle-Aligned Movie Sounds (SAM-S) 数据集图片
构建方式
SAM-S数据集的构建依托于电影中公开的隐藏式字幕文件,通过自动化手段提取时间对齐的音频事件标签。研究团队收集了2014至2018年间430部高票房好莱坞影片的字幕,从中挖掘出超过11万个音频事件。字幕中描述声音的标签被自动提取,随后通过亚马逊土耳其机器人进行人工标注,将标签按声音、来源和质量三个维度分类。标注结果经过词形还原和人工校对,形成初始分类体系。对于低频标签,利用已标注数据构建字典进行自动标注,最终通过人工合并同义词和实体识别,得到包含245个声音类别、183个来源类别和93个质量类别的数据集,共计约9.5万个有效样本。
特点
该数据集最显著的特点在于其平坦化的分类体系,不同于Audioset等数据集基于来源的层级结构,SAM-S将声学相似但来源不同的声音(如不同物体发出的嗡嗡声)归为同一类别,从而增加了每类的样本代表性和声学多样性。数据集高度聚焦于人类中心的声音,包含许多Audioset中缺失的细粒度类别,如哈欠、抽泣、嘟囔和争论等。此外,字幕标签的高精度特性确保了标注的可靠性,尽管召回率较低,但无需大量人工验证。数据集还提供了声音、来源和质量的分离标注,便于研究者针对不同维度进行建模分析。
使用方法
使用时,研究者需将音频事件剪辑为10秒片段,并在事件前后各保留约5秒的上下文信息。数据集按电影划分为训练集(344部)、验证集(43部)和测试集(43部),建议仅使用占总样本量0.1%以上的120个声音类别进行模型开发。基线实验可采用预训练的AST模型进行音频分类,输入为128维对数梅尔频谱图,配合mixup和SpecAugment数据增强。为提升性能,可引入视觉模态,利用CLIP编码器提取每秒一帧的图像特征,通过早期融合的方式与音频特征在Transformer架构中结合,实验证明多模态融合可使平均精度提升约5%。
背景与挑战
背景概述
音频事件检测作为一项基础性的音频处理任务,在自动驾驶、医疗健康及多媒体索引等领域展现出广阔的应用前景。然而,现有大规模数据集如AudioSet的构建高度依赖人工标注与验证,成本高昂且难以规模化。电影作为一种融合现实与虚构场景的丰富媒介,蕴含大量多样化的音频事件,为数据挖掘提供了独特资源。为此,南加州大学信号分析与解释实验室的Rajat Hebbar等人于2023年提出了Subtitle-Aligned Movie Sounds(SAM-S)数据集。该数据集利用公开的隐藏式字幕,从430部好莱坞电影中自动挖掘出超过11万个音频事件,并沿声音、来源和质量三个维度构建了包含245个声音类别的扁平化分类体系。SAM-S不仅填补了电影领域音频事件数据集的空白,其以人为中心的声音类别(如哈欠、抽泣)也显著丰富了现有数据资源,为音频事件检测研究开辟了新路径。
当前挑战
SAM-S数据集面临的核心挑战首先在于领域问题本身:电影音频事件检测需应对高度复杂的声学环境,包括背景音乐、对白干扰及拟音(Foley)产生的声音,这些声音虽与真实声音难以区分,却增加了模型识别的难度。其次,构建过程中挑战显著:隐藏式字幕虽提供高精度标签,但召回率较低,导致大量潜在音频事件未被捕获;字幕标签的表述多样且来源模糊,需通过众包标注、词形还原及自动映射等多步骤处理,才能形成统一的分类体系,其间需人工介入解决标注分歧和合并语义相近类别;此外,电影中同一声音(如嗡嗡声)可能来自多种来源(昆虫、手机、警报),如何在保持声学相似性的同时避免类别爆炸,是分类体系设计的一大难题。
常用场景
经典使用场景
在影视多媒体分析与智能音频处理领域,SAM-S数据集被广泛用于音视频事件检测任务。研究者借助其丰富的电影音效标注,可训练模型识别诸如枪声、脚步声、引擎轰鸣等复杂场景中的非语言音频事件。该数据集通过字幕标签自动挖掘音频事件,覆盖了245种声音类别,涵盖人类发声、环境噪声、机械音效等多元维度,为构建鲁棒的音频事件检测系统提供了极具挑战性的测试床。其独特的平面分类体系打破了传统按声源分层的局限,使得跨来源的声学相似性建模成为可能,尤其适用于电影中音画不同步或声源模糊的场景分析。
实际应用
在实际应用中,SAM-S数据集为智能媒体索引与辅助技术开发提供了关键支撑。影视平台可利用基于该数据集训练的模型自动生成字幕中的音效描述,提升听障人士的观影体验;视频编辑工具可借助音频事件检测快速定位特定音效片段,优化后期制作流程。在智能家居与车载系统中,模型迁移学习自电影中丰富的环境音(如警报器、玻璃破碎声)可增强对现实场景中异常声响的感知能力。此外,结合CLIP视觉特征的音视频融合方法,SAM-S还可用于多模态内容检索,例如通过“爆炸声”与“火焰画面”的联合分析实现电影片段的高效索引与推荐。
衍生相关工作
SAM-S数据集催生了一系列多模态音频事件检测的经典研究。基于其基准实验,研究者提出了AST-MM模型,通过早期融合CLIP视觉特征与音频Transformer,在mAP指标上实现了约5%的相对提升,验证了视觉线索对电影音效识别的增益效果。后续工作进一步探索了注意力瓶颈机制与梯度混合策略,优化了多模态融合中不同模态的过拟合问题。在音频事件定位方面,跨模态注意力网络被引入以处理时间不一致的音画关系,推动了弱监督音视频事件检测的发展。此外,SAM-S与Audioset的标签映射分析揭示了电影特有音效的分布特性,为构建领域自适应音频表示学习提供了数据驱动的理论依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务