遇见数据集

StandardSim

收藏
arXiv2022-02-05 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

StandardSim是由石溪大学和Standard Cognition合作创建的大规模合成数据集,专注于零售环境下的视觉和感知任务。该数据集包含2,134个独特场景,总计25,436张图像,支持多种计算机视觉任务,如语义分割、实例分割、深度估计和对象检测。特别引入了名为‘变化检测’的新任务,旨在模拟零售环境中顾客与商品的互动。数据集通过高度精确的商店模型和详细的标注,为自主结账系统提供了丰富的训练和测试资源,特别适用于解决零售场景中的复杂视觉问题。

StandardSim is a large-scale synthetic dataset co-created by Stony Brook University and Standard Cognition, focusing on visual and perceptual tasks in retail environments. This dataset contains 2,134 unique scenes with a total of 25,436 images, supporting a variety of computer vision tasks including semantic segmentation, instance segmentation, depth estimation, and object detection. Specifically, a novel task named "change detection" was introduced to simulate customer-merchandise interactions in retail scenarios. Leveraging highly precise store models and detailed annotations, the dataset provides rich training and testing resources for autonomous checkout systems, and is particularly suitable for addressing complex visual problems in retail scenarios.

提供机构:
石溪大学
创建时间:
2022-02-05
搜集汇总
数据集介绍
StandardSim 数据集图片
构建方式
在零售场景的自主结账系统中,精细化的场景理解至关重要,然而现有数据集多聚焦于通用室内环境,难以捕捉零售环境中密集堆叠、高度相似的物体特征。为此,StandardSim应运而生,其构建依托于Blender渲染引擎,基于三家真实零售店铺的激光雷达扫描数据,精确复刻了店铺的三维结构。研究中从TurboSquid平台精选456个高质量商品模型构成SkuBank,通过自动化算法随机填充货架,模拟零售场景的密集分布。每张图像采用Cycles引擎渲染,耗时约20秒,并配备多视角相机参数,最终生成超过25,000张图像,涵盖语义分割、实例分割、深度估计及物体检测等丰富标注。
特点
StandardSim最突出的特点在于其针对零售场景设计的独特任务——变化检测,该任务通过成对图像模拟顾客的取放、移动等操作,实现像素级的“取走”、“放置”、“移动”与“无变化”分类。与现有数据集相比,StandardSim提供了多视角数据,每场景平均包含三个相机视角,支持多视图三维重建。此外,其深度估计任务因零售环境中物体密集且尺寸微小,构成了极具挑战性的基准,实验表明当前最先进的DPT-Large模型在该数据集上的绝对相对误差高达83.59%,远高于在其他数据集上的表现,凸显了零售场景的独特性与难度。
使用方法
StandardSim遵循COCO格式提供标注,便于直接接入现有计算机视觉框架。用户可通过官方仓库获取数据生成与渲染管线的开源代码,灵活替换SkuBank中的商品模型,实现即插即用的数据扩展。针对变化检测任务,研究建议采用Deeplabv3等语义分割模型,并引入翻转顺序、左右翻转及像素噪声等数据增强策略,以缓解类别不平衡问题。深度估计任务则可基于MiDaS或DPT-Large模型进行微调,由于场景中存在天花板视角与反光表面,模型需特别关注小物体间的细微深度差异。数据集还支持多视角三维重建,可用于3D物体检测与实例分割等下游任务。
背景与挑战
背景概述
在自主结账系统快速发展的背景下,计算机视觉技术成为实现零售环境细粒度场景理解的核心驱动力。然而,现有数据集多聚焦于通用室内场景或稀疏商品检测,难以应对零售场景中物品密集堆叠、类别高度相似且视角独特的复杂需求。为填补这一空白,由Stony Brook大学与Standard Cognition机构的研究人员于2022年共同构建了StandardSim数据集。该数据集基于真实商店的三维激光扫描模型,通过Blender引擎生成超过25,000张高保真合成图像,涵盖语义分割、实例分割、深度估计与目标检测等多项标注,并首创面向自主结账的像素级变化检测任务,模拟商品取放与位移行为。其多视角设计与零售专属场景为领域研究提供了极具价值的基准,推动了视觉模型在真实商业环境中的适配与优化。
当前挑战
StandardSim数据集所解决的领域问题核心在于零售环境中密集小目标与动态场景理解的挑战。传统图像分类与检测模型在货架顶部视角下难以辨识微小物体,而光照变化、反光表面及物品堆叠进一步加剧了识别难度。构建过程中,研究人员面临多重技术挑战:需通过LiDAR扫描与手工建模精确复现真实商店的结构与纹理;从456个高精度商品模型中随机生成密集且合理的货架布局;设计相机放置算法以模拟天花板视角并避免遮挡;以及开发变化生成算法,模拟顾客取放商品时邻近物品的随机位移。此外,渲染耗时(单张约20秒)与大规模数据生成的计算资源需求亦构成显著瓶颈。这些挑战使StandardSim在变化检测与深度估计任务上成为极具难度的新基准。
常用场景
经典使用场景
StandardSim作为面向零售环境的大规模合成数据集,其经典使用场景聚焦于自主结账系统中的细粒度场景理解。该数据集通过模拟多视角、密集排列的商品布局以及真实商店的照明与反射效果,为语义分割、实例分割、深度估计和目标检测等视觉任务提供了高精度的像素级标注。尤其值得一提的是,它引入了一种新颖的变更检测任务,要求模型在时间序列图像对中逐像素分类物体的取出、放入和移动行为,这成为零售场景下时空感知分析的核心应用。
衍生相关工作
StandardSim衍生了多项经典工作,其中最突出的是变更检测任务的基准化,借鉴了语义分割模型Deeplabv3进行像素级时序分析,并验证了合成数据在真实零售环境中的域迁移可行性。此外,它推动了单目深度估计模型DPT-Large在密集小物体场景下的改进,揭示了现有方法在俯视视角和反射表面上的不足。该数据集还促进了多视图三维重建与实例分割的结合,为后续研究如3D物体检测和零售布局变化分析奠定了基础。
数据集最近研究
最新研究方向
在零售环境自主结账系统的快速发展背景下,StandardSim数据集聚焦于细粒度场景理解这一前沿方向,通过大规模合成数据填补了零售领域实例分割、深度估计及物体检测标注的空白。其核心贡献在于引入了一种新颖的像素级变化检测任务,精准模拟顾客行为中的拿取、放置与移动操作,为智能零售监控提供了关键基准。该数据集结合多视角渲染与真实店铺布局,显著提升了模型在密集小目标场景下的泛化能力,尤其适用于天花板视角的复杂零售环境。当前研究趋势表明,基于StandardSim的基准测试揭示了现有模型在稀疏变化检测与单目深度估计上的局限性,推动了域自适应与多任务学习在自主结账中的融合,对实现无感支付与库存管理优化具有深远意义。
相关研究论文
  • 1
    StandardSim: A Synthetic Dataset For Retail Environments石溪大学 · 2022年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务