ljrljr123/retail_dataset2
收藏官方服务:
资源简介:
该数据集由LeRobot创建,属于机器人技术领域。数据集包含15个episodes和15541帧数据,记录了机器人手臂的各种位置和速度信息(如肩部平移、肩部提升、肘部弯曲等),以及来自前端和腕部摄像头的视频观察数据。视频分辨率为前端480x640,腕部640x480,帧率为30fps。数据集采用apache-2.0许可证。
This dataset was created using LeRobot and belongs to the robotics domain. It contains 15 episodes and 15541 frames of data, recording various positions and velocities of the robot arm (such as arm_shoulder_pan, arm_shoulder_lift, arm_elbow_flex, etc.), as well as video observations from front and wrist cameras. The video resolutions are 480x640 for front view and 640x480 for wrist view, with a frame rate of 30fps. The dataset is licensed under apache-2.0.
提供机构:
ljrljr123搜集汇总
数据集介绍

构建方式
在机器人学习领域,高质量的数据集是推动模型从仿真走向现实的关键基石。retail_dataset2 数据集由 LeRobot 框架精心构建,专为机器人操控任务设计。其数据源自 lekiwi_client 型机器人,共包含 15 个完整的操作回合,累计捕获 15541 帧有效信息。数据以分块形式存储于 Parquet 文件中,同时配合视频文件记录视觉流,实现了结构化的高效存储与便捷访问。数据集针对单一任务进行了系统采集,确保了样本内行为模式的高度一致性,为机器人行为克隆与模仿学习提供了纯净的训练素材。
特点
该数据集的核心特征在于其多模态信息的精细对齐与高保真记录。每个样本均融合了 9 维动作指令与同等维度的机器人状态观测,涵盖机械臂关节位置与底盘速度变量。视觉方面,数据集包含前置与腕部双摄像头视角,分别记录 640×480 与 480×640 分辨率的 RGB 视频流,编码采用高效的 AV1 格式,并以 30 帧每秒的速率稳定同步。完整的时间戳、帧索引与回合索引字段,使得时序依赖模型的训练与评估具备坚实的数据基础。
使用方法
数据集遵循 LeRobot 的标准接口设计,可直接被该框架加载并用于机器人学习流水线。开发者通过 Hugging Face Spaces 提供的可视化工具,能够直观浏览各回合的机器人操作演示。使用时,用户需确保已安装 LeRobot 库,并依据 meta/info.json 中定义的 chunks_size 与数据路径规则,在训练脚本中高效读取 Parquet 数据及其对应的视频文件。全部 15 个回合默认用作训练集,便于研究者直接开展行为克隆或离线强化学习实验。
背景与挑战
背景概述
retail_dataset2 是一个面向机器人操作任务的时序数据集,由研究人员利用 LeRobot 框架于近期创建,数据采集自 lekiwi_client 型号机器人。该数据集聚焦于零售场景下的机械臂操控与移动协同行为,核心研究问题在于如何通过多模态数据(包括本体状态、九维关节动作及前后双路视觉影像)驱动智能体执行精细化的商品拣选与放置任务。尽管数据集规模有限(仅含15个演示片段、15541帧),但其结构完整且高度专业化,为研究少样本模仿学习、领域自适应及人类示范数据下的机械臂控制提供了基准资源,推动了零售自动化这一交叉领域的算法验证与模型泛化能力探索。
当前挑战
该数据集面临的领域挑战在于零售环境下机械臂操作的高度动态性与非结构化特征,如商品尺寸杂乱、光照变化及环境噪声,要求模型从有限的高维视频与状态数据中提取稳健的运动模式。构建过程中主要遭遇三大困难:其一,数据采集依赖手动遥操作,15个示范片段数量稀缺且任务单一,难以覆盖零售场景的多样性;其二,多源传感器(关节编码器、摄像头)的时空对齐与同步校准极其繁琐,特别是30FPS视频流与1000帧分块存储之间的数据一致性维护;其三,视频压缩采用AV1编码导致解码计算开销增大,且缺乏公开论文或引用信息支撑,使得数据集在可复现性与社区采纳方面面临可信度挑战。
常用场景
经典使用场景
retail_dataset2 是一个面向零售场景的机器人操作数据集,专为模仿学习与行为克隆任务而设计。该数据集记录了由 lekiwi_client 机器人平台在单一任务下采集的 15 个完整回合(episode),总计超过 15,000 帧的交互数据,涵盖 9 维关节动作指令(包括机械臂各关节位置与底盘速度)以及对应的状态观测。尤为关键的是,数据集同步提供了前置与腕部双视角的高清视频流(640×480 至 480×640 分辨率,30 FPS),为视觉-动作联合建模提供了丰富的多模态信号。研究者可借助该数据集训练端到端的视觉运动策略,使机器人学会将像素级观察直接映射为关节级控制指令,从而在零售环境中完成诸如货架拣选、商品抓取与摆放等精细化操作任务。
解决学术问题
零售环境中的机器人操作研究长期受制于真实场景数据匮乏的瓶颈,特别是缺乏同时包含高保真视觉观测与精细动作序列的公开数据集。retail_dataset2 的出现有效弥合了这一鸿沟,它为解决从“感知”到“动作”的跨模态映射问题提供了标准化实验平台。学术上,该数据集支持研究者深入探索视觉模仿学习中的关键挑战,例如如何从有限的示范轨迹中泛化到未见状态、如何处理多视角视觉信息中的遮挡与光照变化,以及如何通过状态-动作耦合设计提升策略的鲁棒性。其标准化的数据格式(基于 LeRobot 框架)还推动了可复现研究范式的建立,为对比不同算法(如扩散策略、基于 Transformer 的决策模型)在零售任务中的表现创造了公平基准,进而加速了具身智能在受控商业场景中的理论突破。
衍生相关工作
retail_dataset2 的发布催生了一系列围绕少样本模仿学习和视觉运动控制的研究工作。基于其提供的高质量演示数据,研究者开发了结合行为克隆与隐式策略的混合模型,在有限回合下实现了超越传统方法的操作成功率。同时,该数据集也启发了专门针对零售抓取的多视角特征融合工作,通过将前置与腕部视图在时间与空间维度对齐,显著提升了策略对杂乱背景的鲁棒性。此外,部分学者利用该数据集验证了深度强化学习中的逆强化学习框架,从演示中恢复奖励函数以引导更有效的策略探索。在开源社区层面,数据集推动了 LeRobot 生态中零售基准任务的构建,后续工作如“零售商机器人挑战赛”等均以此为参考,形成了从数据采集、模型训练到硬件部署的完整研究链条。
以上内容由遇见数据集搜集并总结生成



