遇见数据集

standard-cognition/RetailAction

收藏
Hugging Face2025-09-25 更新2025-11-01 收录
官方服务:

资源简介:

RetailAction数据集是一个大规模的数据集,旨在用于多视角时空定位零售环境中的客户与产品交互。该数据集包含了来自10个便利商店的21000个多视角注释样本,总共约41小时的视频。每个样本包含两个同步的顶部视角视频,记录了真实客户的行为。数据集以交互为中心的标签,而不是围绕人的边界框,而是使用点注释来标记物品被触摸的确切位置。数据集包括取、放、触摸等动作类别,并且每个视频都经过高效剪辑,以保证信息的最大化。所有数据都经过匿名处理,以保护隐私。

The RetailAction dataset is a large-scale dataset designed for multi-view spatio-temporal localization of customer-product interactions in real-world retail environments. The dataset consists of 21,000 multi-view annotated samples (approximately 41 hours of video) from 10 convenience stores. Each sample contains two synchronized top-view videos capturing real customer behaviors. The dataset uses interaction-centric labels, with point annotations marking the exact location where an item is touched. It includes action categories such as Take, Put, and Touch, and each video is剪辑ed efficiently to ensure maximum informativeness. All data are anonymized to protect privacy.

提供机构:
standard-cognition
搜集汇总
数据集介绍
standard-cognition/RetailAction 数据集图片
构建方式
RetailAction数据集由Standard AI团队构建,旨在解决真实零售场景中多视角时空定位人-物交互的挑战。数据采集自美国10家便利店的顶置同步摄像头,记录了超过10,000名真实顾客的购物行为。每个样本包含两个视角的短视频片段(≤32帧),并通过运动感知帧评分筛选出最具信息量的帧。标注采用点级方式,精准标记顾客与商品交互的时空位置,包括“拿取”、“放置”和“触摸”三类动作,同时提供18个身体关键点的姿态估计和面部位置信息。数据集按顾客身份划分训练集(17,222样本)、验证集(1,277样本)和测试集(2,501样本),确保无身份泄露。
使用方法
研究人员可通过Hugging Face平台使用git-lfs命令下载完整数据集。下载后需解压训练、验证和测试三个压缩包。每个样本包含两个视角的视频文件(rank0_video.mp4和rank1_video.mp4)以及一个metadata.json文件,其中记录了动作标签(类别、时空坐标)、相机元数据(时间戳、面部位置、姿态数据)和片段信息。评估空间定位时,建议使用基于骨骼长度计算的米/像素因子进行标准化,以公平衡量预测精度。数据集提供了基于DETR的多视角定位基线模型,并报告了多种骨干网络(如MoViNet、SlowFast、MViT)的性能指标,便于研究者对比和复现。
背景与挑战
背景概述
在零售场景中,理解顾客与商品之间的精细化交互行为是推动自动化结账、购物行为分析及智能零售系统发展的关键。然而,现有动作识别数据集多聚焦于日常活动或单一视角下的粗粒度动作,缺乏针对真实零售环境中多视角、时空精准定位的人-物交互研究。为填补这一空白,Standard AI团队于2025年在ICCV零售视觉研讨会上发布了RetailAction数据集。该数据集由Davide Mazzini、Alberto Raimondi等人创建,涵盖21,000个多视角标注样本,总时长约41小时,采集自美国10家便利店的顶置摄像头,包含超过10,000名真实顾客。核心研究问题在于实现细粒度的“拿取”“放置”“触摸”三类交互动作的时空联合定位,为零售场景下的多视角动作定位与人-物交互理解提供了大规模基准,对智能零售领域具有重要推动作用。
当前挑战
RetailAction数据集面临的核心挑战包括:首先,在领域问题层面,现有模型难以同时精准捕捉动作的时空维度,尤其是在顶置多视角下,顾客与商品交互区域小、动作持续时间短(多数≤3秒),且存在大量无动作片段(占9.1%),导致时空定位的精度与召回率难以平衡。其次,构建过程中,数据集需处理真实零售环境中的光照变化、遮挡、多顾客同时活动等复杂场景,且标注采用点级交互位置而非传统边界框,对标注一致性要求极高。此外,多视角视频的同步与归一化(如像素到米的空间度量转换)依赖骨骼长度估算,而部分样本因姿态不完整需使用全局平均因子作为回退,增加了评估的复杂性。这些挑战使得模型在时空联合定位上仍有较大提升空间。
常用场景
经典使用场景
在零售场景中,精准理解顾客与商品之间的交互行为是计算机视觉领域的前沿挑战。RetailAction数据集专为多视角时空定位人类-物体交互而设计,其经典使用场景在于从天花板安装的同步摄像头视频中,同时识别顾客的“拿取”、“放置”和“触碰”三类细粒度动作,并精确标注交互发生的空间坐标与时间区间。该数据集以点级标注替代传统检测框,聚焦于交互点本身,为多视角视频中的细粒度动作识别与时空定位提供了标准化的评测基准。
解决学术问题
RetailAction数据集有效填补了真实零售环境中多视角、细粒度人-物交互时空定位研究的空白。传统动作识别数据集多聚焦于粗粒度日常活动或单视角视频,难以应对零售场景中交互密集、动作幅度小、视角受限等挑战。该数据集通过提供21,000个带有多视角同步视频与点级时空标注的样本,解决了细粒度交互的精确检测与定位问题,推动了动作识别从粗粒度分类向精细化时空定位的学术演进,为多视角融合、时空注意力机制等前沿研究提供了关键数据支撑。
实际应用
在实际应用中,RetailAction数据集直接赋能零售业的智能化升级。基于该数据集训练的模型可部署于无人便利店或传统商超,实现顾客行为的实时分析,例如自动识别商品被拿取或放回的动作,从而支持无感支付、库存管理与货架热力分析。此外,该数据集还可用于优化顾客动线分析与防损监控,帮助零售商提升运营效率与用户体验。其隐私保护设计(面部模糊与标识去除)使得技术落地更符合合规要求,加速了从学术研究到产业应用的转化进程。
数据集最近研究
最新研究方向
随着计算机视觉技术在零售场景中的深度渗透,精准理解人-物交互行为已成为智能零售领域的核心挑战。RetailAction数据集应运而生,其聚焦于多视角时空定位下的细粒度动作识别,如顾客的“取、放、触”行为,突破了传统动作识别依赖单一视角或粗粒度标签的局限。该数据集包含来自10家真实便利店、超过21,000个多视角同步样本,并采用点标注代替传统包围框,显著提升了交互定位的时空精度。当前前沿研究正围绕基于Transformer的多视角融合模型展开,如MViT-b在时空定位平均精度(mAP)上达到41.7%,同时结合运动感知帧采样与骨骼长度归一化度量,为无感结算、顾客行为分析等实际应用提供了可靠的基准。这一工作不仅推动了零售场景下人体-物体交互理解的标准化进程,更对隐私保护下的高效视频分析具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务