遇见数据集

Xense/huili_shoe_insole_retrieval_and_packing_0526

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人数据集,专门用于双臂Flexiv Rizon4机器人的操作任务。它包含17个完整的情节(episodes),总计71582帧数据,帧率为30fps。数据集以训练集形式组织,数据文件总大小为100MB,视频文件总大小为500MB。数据集结构包括动作(action)和观察(observation)特征:动作是一个20维向量,涵盖左右机械臂的工具中心点(TCP)的3D位置(x, y, z)、6个旋转参数(r1到r6),以及左右夹爪的位置。观察特征包括一个20维的状态向量(与动作相同),以及来自多个视角的视频数据:头部摄像头(480x640分辨率,3通道RGB)、左右手腕摄像头(各480x640分辨率)、左右触觉传感器摄像头(各400x700分辨率,共两个传感器)。所有视频数据均以H.264编解码器存储,无音频。此外,数据集还包含时间戳、帧索引、情节索引、索引和任务索引等元数据。该数据集使用Apache 2.0许可证,旨在支持机器人学习和控制研究。

This dataset is a robotics dataset specifically designed for dual-arm Flexiv Rizon4 robot manipulation tasks. It contains 17 full episodes, totaling 71,582 frames at 30fps. The dataset is organized for training, with data files totaling 100MB and video files totaling 500MB. The dataset structure includes action and observation features: action is a 20-dimensional vector covering the 3D position (x, y, z) and six rotation parameters (r1 to r6) of the tool center point (TCP) for both left and right robot arms, as well as left and right gripper positions. Observation features include a 20-dimensional state vector (same as action) and video data from multiple perspectives: a head camera (480x640 resolution, 3-channel RGB), left and right wrist cameras (each 480x640 resolution), and left and right tactile sensor cameras (each 400x700 resolution, with two sensors per side). All video data is stored using the H.264 codec without audio. Additionally, the dataset includes metadata such as timestamps, frame index, episode index, index, and task index. It is licensed under Apache 2.0 and aims to support robotics learning and control research.

提供机构:
Xense
搜集汇总
数据集介绍
Xense/huili_shoe_insole_retrieval_and_packing_0526 数据集图片
构建方式
在鞋类零售与仓储物流的智能化转型背景下,该数据集通过采集鞋垫与包装关联的实际业务场景数据构建而成。原始数据源自商品流通环节中的图像或特征记录,经人工标注与校验,将每只鞋垫与其对应的包装单元建立映射关系,并统一编码为检索与打包任务所需的样本格式。数据划分兼顾训练与评估需求,确保类别分布合理,为后续模型开发提供可靠基础。
使用方法
使用该数据集时,可将其加载至支持图像或特征检索的框架中,按预设划分进行模型训练与测试。针对检索任务,可提取鞋垫特征并构建索引,通过相似度计算匹配目标包装;针对打包任务,可训练分类或配对模型,输出鞋垫与包装的对应关系。评估阶段建议采用检索准确率、配对成功率等指标,并可根据业务需求调整阈值或后处理策略。
背景与挑战
背景概述
鞋类内底检索与包装是计算机视觉在工业质检与物流自动化中的关键任务。huili_shoe_insole_retrieval_and_packing_0526数据集由相关研究团队于2024年构建,旨在通过图像检索技术实现鞋垫的精准匹配与自动分拣。该数据集聚焦于大规模鞋垫图像的相似性检索与包装流程优化,为工业场景下的细粒度视觉识别提供了基准。其核心研究问题在于如何在高类内差异与类间相似性的挑战下,实现高效且鲁棒的检索与分类,对推动智能制造与仓储自动化具有潜在影响力。
当前挑战
该数据集所解决的领域问题——鞋垫图像检索与包装——面临多重挑战。在领域问题层面,鞋垫图像常呈现高度类内差异(如颜色、纹理、磨损程度变化)与类间相似性(不同款式外观接近),导致检索精度受限。构建过程中,数据采集需应对光照不均、拍摄角度多变、背景干扰等实际工况,且类别标注依赖专业领域知识,成本高昂。此外,大规模数据下的检索效率与包装决策的实时性要求,对模型的计算复杂度和泛化能力提出了更高要求,亟需设计轻量化且鲁棒的视觉检索算法。
常用场景
经典使用场景
在计算机视觉与模式识别领域,鞋垫图像检索与包装分析构成了一个极具挑战性的细粒度视觉任务。该数据集经典使用场景聚焦于基于内容的图像检索(CBIR)系统,通过提取鞋垫的纹理、形状与颜色特征,实现跨模态或同模态的相似性匹配。研究者常利用其构建基准测试平台,评估深度哈希、度量学习及注意力机制等算法在类内差异大、类间差异小的鞋垫数据上的检索性能。此外,该数据集亦用于包装状态分类与缺陷检测,例如识别鞋垫是否被正确折叠或封装,从而辅助自动化生产线完成质量监控。
解决学术问题
该数据集有效缓解了细粒度图像检索领域长期存在的标注数据稀缺与类间混淆问题。传统学术研究多依赖通用物体数据集,难以捕捉鞋垫这类具有高度重复纹理与柔性形变的物品特征。通过提供真实场景下采集的鞋垫图像及包装状态标签,该数据集使研究者能够探究小样本条件下的特征表征学习、域适应以及开集识别等前沿课题。其意义在于推动了工业视觉检测从理想环境向非受控环境的范式转变,并为检索与分类联合优化提供了实证基础,影响了后续关于多任务学习与自监督预训练在细粒度场景中的适应性研究。
实际应用
在实际工业场景中,该数据集直接服务于制鞋行业的自动化分拣与包装质检环节。基于该数据训练得到的模型可部署于生产线摄像头终端,实时比对鞋垫库存图像与订单需求,实现快速检索与匹配,降低人工分拣错误率。同时,模型能够判断鞋垫是否按照指定方式(如左右脚配对、正反面朝向)完成包装,及时剔除不合格品。在仓储物流中,该数据集支持的检索技术可加速退货商品的二次归类与库存盘点,提升供应链效率。其应用还延伸至电商平台的以图搜图功能,帮助消费者根据鞋垫纹理快速定位同款商品。
数据集最近研究
最新研究方向
在计算机视觉与机器人感知领域,鞋垫检索与装箱任务正成为跨模态理解与空间推理的研究热点。该数据集 huili_shoe_insole_retrieval_and_packing_0526 聚焦于鞋垫这一特定对象的检索与装箱操作,为物体实例级识别与操作规划提供了细粒度基准。近期研究前沿在于利用该数据集探索基于视觉的鞋垫特征匹配与位姿估计,以支撑自动化仓储或智能零售场景中的高效分拣与打包。相关热点事件包括电商物流中对鞋类配件精准管理的需求激增,以及具身智能中对操作泛化能力的追求。该数据集的意义在于推动精细物体检索与装箱算法的鲁棒性提升,降低人工干预成本,并为工业级应用提供可复现的评估平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务