ANDRYHA/OpenSAL360
收藏官方服务:
资源简介:
OpenSAL360是一个开源众包平台,用于收集全向视频显著性数据。该数据集是目前最大的全向视频显著性数据集,包含500个视频,平均时长为18.1秒,收集了超过2000名观察者(每个视频超过84名)的注视点数据。视频包含音频轨道,分辨率为3840x1920,内容来自YouTube,具有多样性。数据集采用CC-BY许可证,文件结构包括原始视频、显著性图视频、注视点JSON文件和元数据JSON文件。
OpenSAL360 is an open-source crowdsourcing platform for omnidirectional video saliency collection. This dataset is the largest omnidirectional video saliency dataset, featuring 500 videos with a mean duration of 18.1 seconds, fixations from over 2000 observers (over 84 per video), audio tracks, high resolution of 3840x1920, diverse content from YouTube, and a CC-BY license. The file structure includes videos, saliency maps, fixation data in JSON format, and a metadata file.
提供机构:
ANDRYHA搜集汇总
数据集介绍

构建方式
OpenSAL360数据集是当前规模最大的全景视频显著性数据集,基于开源众包平台构建。研究团队从YouTube平台收集了500段分辨率为3840x1920、时长平均18.1秒的全景视频,涵盖多样化的自然场景内容。每段视频均保留音频轨道以模拟真实观看体验。通过众包方式招募超过2000名观察者,每段视频获得至少84份注视点数据,最终生成逐帧的注视坐标文件(JSON格式),并据此转换为连续显著性图(以近乎无损CRF 0、10bit编码的MP4视频存储)。所有视频均采用等距柱状投影(ERP)格式处理。
特点
该数据集具有多项显著优势:规模宏大,包含500段高质量全景视频,远超同类数据集;注视数据来自2000余名观察者,每视频平均84份样本,统计可靠性强;视频保留音频轨道,确保多模态显著性研究的生态效度;全部分辨率达到4K级别(3840×1920),细节丰富;内容来源广泛,涵盖YouTube上多样化场景,增强泛化能力。数据采用CC-BY许可协议发布,便于学术复用。数据集同时提供原始视频、显著性图、注视坐标及元数据文件,支持多层面分析。
使用方法
研究者可直接使用预生成的显著性图视频(`saliency`目录)进行模型训练或评估,也可利用注视坐标文件(`fixations`目录)自行构建个性化显著性图。元数据(`metadata.json`)提供每段视频的许可信息及来源URL,便于合规使用。数据集适用于全景视频显著性预测模型的基准测试、视觉注意力机制研究,以及多模态(视听联合)显著性分析。建议将视频按视觉内容或运动模式拆分训练/测试集,并结合注视密度图进行定量评估。
背景与挑战
背景概述
在沉浸式视频体验日益普及的背景下,全景视频作为虚拟现实(VR)与增强现实(AR)的核心内容形式,其视觉显著性预测成为计算机视觉与多媒体领域的研究热点。传统平面视频的显著性模型无法直接迁移至全景视频,原因在于全景视频的球面特性、观看者视角自由以及头戴式显示设备的交互方式引入了新的复杂性。自2020年起,由密歇根州立大学视频研究组主导,联合国际多家机构发起OpenSAL360项目,旨在构建一个开源、大规模的全景视频显著性数据集。该数据集于2022年正式发布,包含500段高分辨率(3840x1920)的全景视频,每段平均时长18.1秒,并收集了超过2000名观者在自然观看条件下(含音频刺激)的眼动注视数据,平均每段视频获得84人次的注视标注。其开源平台与CC-BY许可协议为学术界提供了可复现的基准,推动了全景视频显著性模型的公平比较与性能提升。
当前挑战
OpenSAL360数据集的构建与利用面临多重挑战:首先,在领域问题层面,全景视频的球面扭曲效应对传统平面显著性模型构成根本性障碍,需要设计适配球面几何的归一化算法与评价指标;其次,观看者视角的自由度导致注视数据的高度个体差异性,预测模型需同时捕捉群体共性注视模式与个性化注视行为。在数据构建过程中,挑战尤为显著:大规模线上众包实验需克服硬件差异(如头显分辨率、刷新率)与网络延迟对注视精度的影响;为保障数据质量,需设计严格的质量控制流程,包括剔除无效试次、校准眼动仪误差以及平衡不同观看者的人口统计学分布。此外,视频时长与内容多样性(涵盖自然景观、体育赛事、动画等)增加了标注成本,而音频轨道的同时呈现使显著性因素的分析更为复杂,需解耦视觉与听觉的交互作用。
常用场景
经典使用场景
在沉浸式视觉体验与人类注意力机制的交汇领域,OpenSAL360数据集为全景视频显著性预测提供了迄今为止规模最为庞大的标准化评测基准。该数据集汇集了500段时长平均18.1秒、分辨率高达3840×1920的全景视频,每段视频均采集自超过84名被试者的眼动注视点数据,总计参与观测者逾2000人次。研究者可借此深入探究全景场景下人类视觉注意力的动态分布规律,通过训练与评估显著性预测模型,精准捕捉360度环境中观者注视迁移的时空特性。该数据集保留了原始音频轨道,使得多模态显著性建模成为可能,尤其适用于探索音频线索对视觉注意力引导的复杂交互作用。
衍生相关工作
OpenSAL360的开放性与大规模特性已催生了一系列具有影响力的衍生工作,推动了全景视频理解技术的纵深发展。基于该数据集,研究者提出了融合球面空间几何特性的时空显著性网络,如球面残差卷积架构与等矩形投影畸变校正模块。在注意力机制建模领域,衍生工作探索了全景场景中视觉搜索任务的注视路径预测,揭示了全景视频中自上而下与自下而上注意力的耦合规律。此外,该数据集还促使多模态显著性预测模型的出现,将音频能量特征与视觉显著性先验进行跨模态融合,开创了视听联合显著性建模的全新范式。
数据集最近研究
最新研究方向
在沉浸式视觉体验领域,全景视频的视觉显著性预测是理解用户注意力机制的核心课题。OpenSAL360作为目前规模最大的开源全景视频显著度数据集,依托众包平台采集了超过2000名观测者对500段高分辨率视频的注视点数据,并首次纳入了音频模态与自然内容多样性,为多模态显著性建模、动态注视点预测及全景视频压缩优化提供了关键基准。该数据集的出现推动了跨学科研究,如结合时空Transformer与声场特征的注意力解耦模型,有望显著提升虚拟现实中的视点渲染效率与用户体验质量。
以上内容由遇见数据集搜集并总结生成



