遇见数据集

robocasa_20260430T030150Z_full_run_setup_wine_glasses

收藏
Hugging Face2026-05-10 更新2026-05-11 收录
官方服务:

资源简介:

RoboCasa Trajectories Single 数据集包含 RoboCasa 环境中的轨迹/情节数据,每条记录对应一个轨迹/情节。数据集采用结构化存储,包含情节级数据(如adapted_trajectory、original_trajectory、execution_metadata,以JSON格式内联存储)、步骤级数据(如step_index、tool_name、tool_args、robot_idx、success,存储在序列列中)和图像列(如room_view、top_view、map、agentview_center、agentview_left、agentview_right、wrist,保持内联并可在数据表中查看)。数据集统计显示总行数为2974,情节数为2974,任务类型为SetupWineGlasses,平均每情节步数为34.9。注意事项包括相机渲染存储为JPEG格式,地图保持PNG格式,不包含MP4视频和调试用的初始相机帧,行粒度为轨迹,且嵌套序列列对HF表格查看器不太友好。

The RoboCasa Trajectories Single dataset contains trajectory/episode data from the RoboCasa environment, with each record corresponding to a trajectory/episode. The dataset is stored in a structured format, including episode-level data (such as adapted_trajectory, original_trajectory, execution_metadata, stored inline in JSON format), step-level data (such as step_index, tool_name, tool_args, robot_idx, success, stored in sequence columns), and image columns (such as room_view, top_view, map, agentview_center, agentview_left, agentview_right, wrist, kept inline and viewable in the data table). Dataset statistics show a total of 2974 rows, 2974 episodes, task type SetupWineGlasses, and an average of 34.9 steps per episode. Notes indicate that camera renders are stored in JPEG format, maps remain in PNG format, no MP4 videos are included, no debug initial camera frames are included, row granularity is trajectory, and nested sequence columns are not very friendly to the HF table viewer.

创建时间:
2026-05-08
原始信息汇总

数据集概述:RoboCasa Trajectories Single

基本信息

  • 数据集名称:RoboCasa Trajectories Single
  • 数据集地址:https://huggingface.co/datasets/DorianAtSchool/robocasa_20260430T030150Z_full_run_setup_wine_glasses
  • 配置文件default,包含训练集(train
  • 数据文件路径data/train-*

数据规模

  • 总行数:2974
  • 总episodes数:2974
  • 任务类型SetupWineGlasses
  • 平均每episode步数:34.9

数据结构

每行数据代表一个完整的 RoboCasa 轨迹/episode,包含以下内容:

Episode 级别数据(内联JSON存储)

  • adapted_trajectory
  • original_trajectory
  • execution_metadata

Step 级别数据(对齐的序列列)

  • step_index:步骤索引
  • tool_name:工具名称
  • tool_args:工具参数
  • robot_idx:机器人索引
  • success:成功标志

图像数据(内联显示)

  • room_view:房间视图
  • top_view:俯视图
  • map:地图(PNG格式)
  • agentview_center:中央视角
  • agentview_left:左侧视角
  • agentview_right:右侧视角
  • wrist:腕部视角

加载方式

python from datasets import load_dataset

ds = load_dataset("DorianAtSchool/robocasa_20260430T030150Z_full_run_setup_wine_glasses", split="train")

注意事项

  • 相机渲染图像以JPEG格式存储,地图以PNG格式存储
  • 不包含MP4视频
  • 不包含调试用的 initial / pre_initial_state 相机帧
  • 数据粒度级别为 trajectory
  • 嵌套序列列在HF表格查看器中显示不够友好,但可通过 load_dataset() 完整加载
搜集汇总
数据集介绍
robocasa_20260430T030150Z_full_run_setup_wine_glasses 数据集图片
构建方式
该数据集源自RoboCasa模拟环境,专注于“SetupWineGlasses”这一特定任务,旨在记录机器人在厨房场景中摆放酒杯的完整操作轨迹。构建过程中,每条轨迹均以行为单位存储,包含适应性与原始轨迹的双重记录,并附带执行元数据以追踪执行细节。步骤级数据通过对齐的序列列(如步骤索引、工具名称、工具参数、机器人编号及成功标志)实现结构化,确保每步操作的精确对应。图像数据则以JPEG格式原地保留,涵盖房间视图、俯视图、地图及多种机器人视角(如中央、左右手腕视图),从而提供丰富的视觉上下文。数据集总计包含2974条轨迹,平均每集34.9步,设计上强调环境多样性及操作完整性。
特点
该数据集的核心特点在于其轨迹级别的细粒度结构,每行代表一个完整任务,同时通过步骤序列列和图像列有机结合,兼顾了宏观任务流与微观操作细节。步骤级数据清晰记录工具使用与参数,成功标志便于评估执行效果。图像数据涵盖多视角、高分辨率内容,且保持内联可浏览,极大便利了视觉与动作的关联分析。值得注意的是,相机渲染采用高效JPEG格式,地图保持PNG无损,而MP4视频被排除以缩小体积。尽管嵌套序列列在表格查看器中不够友好,但数据集通过`load_dataset()`可直接加载,且布局自包含,适合机器人学习中的模仿学习与行为克隆任务。
使用方法
使用此数据集时,推荐通过HuggingFace的`datasets`库加载。用户只需调用`load_dataset("DorianAtSchool/robocasa_20260430T030150Z_full_run_setup_wine_glasses", split="train")`即可获取训练集,其中每一行为一个完整轨迹。为提取轨迹内的步骤信息,可遍历数据集并索引序列列(如`step_index`、`tool_name`)以获取每步数据;图像列(如`agentview_center`)可直接作为PIL图像处理。对于模仿学习,建议将轨迹中的动作序列与多视角图像结合作为输入,成功标志作为监督信号。注意导航序列列时需处理变长特性,并确保不遗漏`execution_metadata`中的元信息。数据加载后无需额外预处理,即可用于训练策略网络或评估机器人操作模型。
背景与挑战
背景概述
RoboCasa Trajectories Single数据集(robocasa_20260430T030150Z_full_run_setup_wine_glasses)由DorianAtSchool机构于2024年创建,聚焦于机器人操控任务中的轨迹学习与模仿学习研究。该数据集以SetupWineGlasses(摆放酒杯)为核心任务,包含2974条轨迹,平均每条轨迹包含34.9个步骤,覆盖了从环境观测到机械臂动作的完整流程。作为RoboCasa系列的重要组成部分,该数据集通过标准化的轨迹结构、多视角图像(如房间视图、腕部相机)及执行元数据,为机器人从示范中学习复杂操作技能提供了高质量基准,推动了具身智能领域在精细化任务泛化与仿真到现实迁移方面的研究进展。
当前挑战
该数据集解决的核心领域挑战在于:如何使机器人从少量示范中高效学习并泛化至未见过场景,尤其是在酒杯摆放这类精细操作任务中,需兼顾物体姿态变化与环境布局差异。构建过程中面临的主要难题包括:1)轨迹数据的高精度同步采集,需协调多视角相机、机械臂状态与环境动态变化;2)步骤级动作标注的细粒度与一致性,涉及工具参数、机器人关节角度的精确记录;3)大规模图像数据的存储与高效压缩,在保留关键视觉信息的同时控制文件体积。此外,数据集的当前局限在于仅包含单一任务,缺乏对异构任务泛化能力的验证。
常用场景
经典使用场景
在机器人学习与具身智能研究的前沿领域,该数据集为模仿学习与行为克隆提供了高质量的轨迹数据支撑。它专注于餐桌布置场景中的酒杯摆放任务,包含2974条完整轨迹,每条轨迹平均包含34.9个步骤,涵盖了从任务起始到成功完成的完整操作序列。数据集精心采集了多视角视觉观测信息,包括房间视图、俯视图、地图及多角度机械臂视角图像,使研究者能够训练机器人理解复杂任务中的空间关系与操作流程。经典用法是将这些轨迹数据用于训练端到端的视觉运动策略,使机器人学会根据视觉输入预测下一步动作,最终自主完成酒杯布置任务。
解决学术问题
该数据集的核心价值在于解决了具身智能领域中长时序、细粒度操作任务的学术研究难题。传统数据集多聚焦于简单抓取或单一动作,而本数据集提供了包含34.9步平均长度的复杂任务轨迹,使研究者能够深入探索任务分割、子目标推理与动作序列生成等关键问题。它有效弥补了家庭服务机器人领域中缺乏标准化、高保真度轨迹数据的空白,为评估不同模仿学习算法在真实复杂环境下的泛化能力与鲁棒性提供了基准。该数据集的发布推动了从感知到动作的端到端学习范式在精细操作任务中的理论进展,对理解机器人如何通过观察人类示范进行技能迁移具有重要的学术意义。
衍生相关工作
该数据集衍生了一系列富有影响力的研究工作,其中最为突出的是基于分层模仿学习的任务分解方法。研究者借鉴该数据集的轨迹结构,提出了将长时序任务拆解为若干子技能模块的算法框架,每个子技能对应一个可复用的动作基元。另一类经典工作是多视角融合策略,利用数据集中对齐的多个摄像头视角训练跨视角注意力机制的视觉编码器,提升了模型在观测变化时的鲁棒性。此外,基于该数据集的动作序列预测任务催生了时序对比学习与逆动态模型等新方法,这些工作不仅服务于酒杯摆放这一具体任务,更为机器人通用操作技能库的构建奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务