遇见数据集

WarehousePick-v0-Sim-DigitalTwin

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集是基于 LeRobot 框架创建的机器人操作数据集,来源于模拟数字孪生环境中的仓库拣选任务(WarehousePick-v0-Sim-DigitalTwin)。数据集包含 82 个 episode,共 57235 帧,帧率为 30 FPS。特征包括 6 维动作(肩关节、肘关节、腕关节和夹爪位置)和 6 维状态(相同关节位置),以及三个摄像头视角的观测图像:innomaker 摄像头(720×1280 像素)、intel_rgb 摄像头(424×240 像素)和 front 摄像头(720×1280 像素),均为 3 通道彩色视频。此外还包括时间戳、帧索引、episode 索引、索引和任务索引。机器人类型为 so101_follower。数据以 Apache-2.0 许可证发布,适用于机器人学习、模仿学习、强化学习等任务。

This dataset is a robot manipulation dataset created based on the LeRobot framework, sourced from a warehouse picking task (WarehousePick-v0-Sim-DigitalTwin) in a simulated digital twin environment. It contains 82 episodes with a total of 57,235 frames at 30 FPS. Features include 6-dimensional actions (shoulder, elbow, wrist, and gripper positions) and 6-dimensional states (same joint positions), along with observations from three camera views: innomaker camera (720×1280 pixels), intel_rgb camera (424×240 pixels), and front camera (720×1280 pixels), all in 3-channel color video. Additionally, it includes timestamps, frame indices, episode indices, indices, and task indices. The robot type is so101_follower. The data is released under the Apache-2.0 license and is suitable for tasks such as robot learning, imitation learning, and reinforcement learning.

创建时间:
2026-09-02
原始信息汇总

WarehousePick-v0-Sim-DigitalTwin 数据集总结

基本信息

  • 任务类别:机器人(Robotics)
  • 许可证:Apache-2.0
  • 标签:LeRobot
  • 代码库版本:v3.0
  • 创建方式:使用LeRobot(Hugging Face的机器人学习框架)生成
  • 帧率(fps):30

数据集规模

  • 总片段数(Total Episodes):82
  • 总帧数(Total Frames):57,235
  • 任务数量:1
  • 数据文件大小:100 MB
  • 视频文件大小:200 MB
  • 数据集划分:训练集包含全部82个片段(splits: train "0:82")

特征与数据格式

  • 数据文件格式:Parquet(存放于 data//.parquet)
  • 视频格式:MP4,编码为AV1,像素格式为yuv420p,无音频

动作与状态空间(均为6维,float32)

包含以下关节位置信息:

  • shoulder_pan.pos(肩部旋转)
  • shoulder_lift.pos(肩部升降)
  • elbow_flex.pos(肘部弯曲)
  • wrist_flex.pos(腕部弯曲)
  • wrist_roll.pos(腕部旋转)
  • gripper.pos(夹爪)

视觉观测(3个摄像头视角)

摄像头 分辨率 (H x W) 通道数
innomaker 720p x 1280p 3
intel_rgb 424p x 240p 3
front 720p x 1280p 3

其他特征(均为时间戳类信息)

  • timestamp(时间戳,float32)
  • frame_index(帧索引,int64)
  • episode_index(片段索引,int64)
  • index(索引,int64)
  • task_index(任务索引,int64)

机器人类型

  • 采用 so101_follower(SO-101 跟随机器人)配置

数据集结构说明

数据以分块(chunk)方式组织,每个分块大小为1000帧。分块路径格式为:

  • 数据文件路径:data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件路径:videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

备注

该数据集没有提供主页(Homepage)和论文(Paper)链接,引用信息(Citation)部分标注为"需要更多信息",目前无可用引用格式。

搜集汇总
数据集介绍
WarehousePick-v0-Sim-DigitalTwin 数据集图片
构建方式
在机器人学习与数字孪生技术交汇的背景下,该数据集依托LeRobot框架构建,采用仿真与数字孪生相结合的方式生成。数据采集过程中,通过so101_follower机器人执行仓库拣选任务,同步记录六自由度关节位置的动作与状态信息,并以30帧每秒的速率采集三路视频流,分别来自innomaker、intel_rgb与front视角。所有数据经过标准化处理,存储为Parquet格式,并划分训练集,最终形成包含82个回合、57235帧的完整数据集,为机器人操作策略的学习与评估提供了可复现的仿真基础。
特点
该数据集在机器人操作领域展现出若干值得关注的特征。其动作与状态空间均采用六维连续表示,涵盖肩部旋转、升降、肘部弯曲、腕部弯曲与旋转以及夹爪开合,便于直接用于模仿学习与强化学习算法。多视角视觉观测的引入——包括高分辨率前视与低分辨率RGB图像——增强了模型对场景的鲁棒感知能力。时间同步的视频与关节数据流以30帧每秒对齐,且每帧均标注时间戳、帧索引、回合索引与任务索引,为时序建模提供了细粒度监督。数据集仅包含单一拣选任务,但回合数量充足,适合作为数字孪生环境下的基准测试资源。
使用方法
使用该数据集时,研究者可借助LeRobot库进行加载与解析,其目录结构遵循v3.0代码库版本,数据文件位于data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet路径下,视频文件则存储于videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4。配置文件meta/info.json详细定义了特征名称、维度与视频属性,便于直接读取。训练集划分为0:82,可直接用于模型训练。此外,数据集提供了可视化工具链接,用户可通过Hugging Face Spaces在线浏览视频与状态轨迹,辅助数据质量检查与算法调试。
背景与挑战
背景概述
在具身智能与机器人操作学习迅猛发展的当下,训练策略的泛化性与数据效率高度依赖于高保真仿真环境与真实世界之间的一致性。WarehousePick-v0-Sim-DigitalTwin数据集正是在这一需求下应运而生,其命名中的“DigitalTwin”昭示了以数字孪生技术弥合仿真与真实差距的初衷。该数据集由LeRobot框架构建,包含82条演示轨迹与57235帧多视角视觉-动作同步数据,涵盖前视、腕部及Intel RGB三个视角,并以30fps记录六自由度机械臂的精细操作,聚焦仓库场景下的抓取任务。尽管具体创建时间与研究人员尚未在现有信息中披露,其开源协议与标准化格式已为机器人学习社区提供了可复用的基准资源,对推动仿真到真实迁移研究具有潜在影响力。
当前挑战
该数据集所应对的核心领域挑战在于仓库抓取任务的复杂性:目标物体姿态多变、光照条件差异以及杂乱堆叠环境对视觉感知与运动规划构成严峻考验。构建过程中的挑战同样显著,实现仿真与真实世界之间的数字孪生映射需要精确标定相机内外参、机械臂运动学参数以及时间同步机制,任一环节的微小偏差都会导致视觉-动作序列的语义漂移。多视角视频流的高帧率同步采集与压缩编码亦带来存储与传输负担,而仅有的82条轨迹在任务多样性覆盖上可能受限,如何确保数据分布足以支撑策略的泛化学习,仍是该数据集在后续应用中需持续验证与拓展的关键问题。
常用场景
经典使用场景
在机器人学习与具身智能研究领域,模仿学习与视觉-动作策略的联合建模长期依赖高质量、多视角的示教数据。WarehousePick-v0-Sim-DigitalTwin数据集恰为这一需求提供了典型范例:其以30Hz频率同步采集六自由度机械臂的关节位置与三路视觉观测(innoMaker全局视角、Intel RGB腕部特写及前向主视角),完整记录了82个回合共57235帧的仓储抓取任务示教轨迹。研究者可据此开展行为克隆、视觉-语言-动作模型训练及数字孪生环境中的策略迁移验证。
解决学术问题
该数据集直面机器人操作学习中若干长期存在的学术难题。其一,多视角视觉输入与本体感知状态的时序对齐问题,为视觉-运动策略的鲁棒性研究提供了标准化数据支撑。其二,在仿真数字孪生环境中采集的示教数据能否有效迁移至真实物理系统,是Sim-to-Real领域的核心议题,本数据集以统一的任务定义与规范化的状态-动作空间为该问题提供了可复现的实验基准。其三,其Apache-2.0许可与LeRobot标准化格式促进了数据共享与结果可比性,对推动具身智能研究的可重复性具有积极意义。
衍生相关工作
围绕该数据集,研究者可衍生出若干经典工作方向。基于LeRobot生态,可构建模仿学习基线(如ACT、Diffusion Policy)在仓储抓取任务上的性能评测;结合数字孪生框架,可开展域随机化与Sim-to-Real迁移方法的对比研究;利用多视角视频流,可探索三维场景重建与物体位姿估计的联合优化;同时,该数据集支持视觉-语言-动作模型的微调,为指令条件下的仓储操作任务提供数据基础,进而推动具身智能在工业物流领域的落地研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务