遇见数据集

robocasa24-atomic-success100-256

收藏
Hugging Face2026-08-29 更新2026-08-30 收录
官方服务:

资源简介:

RoboCasa-24 Atomic Success-100 RGB 256 是一个用于机器人操作模仿学习的实验性数据集,基于RoboCasa v0.2的Atomic-24协议。数据集包含24个原子任务(不包括NavigateKitchen),每个任务收集了100个成功的演示episode,总计2400个episode,共679298帧图像。数据以三个同步的256x256 RGB相机视图和几何ID分割图形式提供,并包含与RGB对齐的演员/链接掩码,但不包含深度信息。所有2400个episode的语义注释均已通过审核。数据集中的PICK->PLACE边界依据稳定抓取、提升和短暂稳定来定义,DoubleDoor任务的顺序按每个episode的联合完成顺序确定。动作长度为50,且动作块不能跨越episode边界。数据集未预设训练/测试划分,下游评估采用闭环成功率。数据由两个独立源(base50和additional50)逻辑联合构成,每个源提供100个episode中的50个,但不应跨源或跨episode连接动作块。规范统计信息保持任务局部性。数据以HDF5文件形式组织,包含原始数据、掩码、语义注释、规范统计、清单和适配器等。该数据集适用于基于视觉的机器人操作策略训练,特别是模仿学习场景。

RoboCasa-24 Atomic Success-100 RGB 256 is an experimental dataset for robot manipulation imitation learning, based on the Atomic-24 protocol of RoboCasa v0.2. It contains 24 atomic tasks (excluding NavigateKitchen), each with 100 successful demonstration episodes, totaling 2,400 episodes and 679,298 frames of images. The data is provided in three synchronized 256x256 RGB camera views and geometric ID segmentation maps, along with RGB-aligned actor/link masks, but without depth information. Semantic annotations for all 2,400 episodes have been reviewed. The PICK->PLACE boundary is defined based on stable grasping, lifting, and brief stabilization, and the order of the DoubleDoor task is determined by the joint completion order of each episode. The action length is 50, and action chunks cannot cross episode boundaries. The dataset does not have a predefined training/testing split, and downstream evaluation uses closed-loop success rate. The data is logically composed of two independent sources (base50 and additional50), each providing 50 of the 100 episodes, but action chunks should not be concatenated across sources or across episodes. Norm statistics maintain task locality. The data is organized in HDF5 files, containing raw data, masks, semantic annotations, norm statistics, manifests, and adapters. This dataset is suitable for training vision-based robot manipulation policies, especially for imitation learning scenarios.

创建时间:
2026-08-29
原始信息汇总

数据集概述

RoboCasa-24 Atomic Success-100 RGB 256 是一个面向机器人操作与模仿学习的公开实验数据集,专门为 RoboCasa v0.2 的 Atomic-24 协议设计。数据集包含 24 个原子任务,共 2,400 个成功轨迹,总计 679,298 帧图像。

核心规格

  • 任务数量:24 个原子任务(不包含 NavigateKitchen
  • 轨迹规模:每个任务包含 100 个成功片段,总计 2,400 个片段
  • 图像数据:三个同步的 256x256 RGB 摄像头视角,附带几何 ID 分割,不含深度信息
  • 掩码信息:actor/link 掩码与 RGB 图像对齐
  • 语义标注:全部 2,400 个语义标注均已通过审核,无待审项目
  • 动作范围:动作时间范围为 50,且片段不得跨越轨迹边界
  • 数据划分:数据集不预设训练/评估划分,下游评估采用闭环成功率

数据组织

数据集的固定协议基于 RoboCasa 提交版本 756598a5be52e052339bb2d957426e39015c2afb,成功-100 注册表由独立的 base50additional50 两部分构成,二者为逻辑上的并集。数据布局包括:

  • 主数据data/base50/<Task>/success50_rgb_seg_256_upright.hdf5data/additional50/<Task>/additional50_rgb_seg_256_upright.hdf5
  • 放置目标掩码masks/ 目录下按 base50_place_targetsadditional50_place_targets 分别存放,包括自动接受和人工审核解决的部分
  • 语义标注annotations/semantic/{base50,additional50}/<Task>.json
  • 归一化统计norm_stats/success100/<Task>.json
  • 清单与适配器manifests/adapter/ 以及补丁文件 patches/track4world_compat.patch
  • 报告与校验reports/PAYLOAD_MANIFEST.json

数据下载

数据集支持整体下载和按任务选择性下载。下载后需根据 PAYLOAD_MANIFEST.json 校验所有文件完整性。推荐下载命令示例(需将 hf 命令替换为实际 Hugging Face CLI 用法):

bash hf download Zhiyuan17/robocasa24-atomic-success100-256 --repo-type dataset --local-dir /workspace/vla/robocasa24_atomic_data

复现要求

复现环境需要安装固定的 RoboCasa 检出版本及其资产。Track4World 需使用提交 d23e6be7965a039b8dacf3eab7492d7527b1f6ac,并应用 patches/track4world_compat.patch(补丁后预期 git diff SHA256 为 1891585775b667816ca8ffbb292cea577f893750edd07331653a76f57dd41ff3)。该补丁仅做兼容性调整,不涉及算法修改。

数据注意事项

  • 数据集明确说明 states 仅为回放/特权元数据,不作为策略输入
  • 在拼接动作片段时,不得跨越片段边界或数据源边界
  • 归一化统计信息按任务局部计算
  • 固定按钮任务使用显式碰撞代理 actor 掩码,因为固定 RoboCasa v0.2 资产未提供独立的可见按钮几何体
  • 数据集中不包含正式的 VLA 训练结果、完整缓存或正式评估输出
  • 真实 Geometry/Motion 教师权重未包含在内,需自行运行小型教师缓存烟雾测试和身份/模式门控检查

来源与限制

更多详细说明请参阅 reports/SUCCESS100_FINAL_REPORT_ZH.md、机器可读的最终报告、语义协议以及 PAYLOAD_MANIFEST.json

搜集汇总
数据集介绍
robocasa24-atomic-success100-256 数据集图片
构建方式
本数据集源自RoboCasa v0.2的Atomic-24协议,并严格锁定于固定代码提交版本,以确保数据生成的可复现性。数据集涵盖24项原子操作任务,每项任务精心采集100个成功演示片段,累计形成2,400个片段与679,298帧图像。在数据采集过程中,系统同步记录三台256x256分辨率RGB相机的视觉流与几何ID分割掩码,并为每个动作提供细粒度的演员与链接掩码,与之对齐的还有语义标注。针对PICK与PLACE轨迹,数据集依据稳定抓取、抬升及短暂稳定性的准则界定边界,确保动作语义的精确性。此外,数据集的构建包含基础与补充两个各含50个片段的独立来源,通过逻辑并集形成完整的成功集,并分别提供对应的放置目标掩码,最终经人工审查与自动验收确保标注质量。
特点
该数据集在设计上凸显多项独特优势。首先,其状态信息仅作为回放与特权元数据,而非策略输入,保证了训练与评估的纯粹性。动作预测视界固定为50步,且严格避免跨片段拼接,维护了动作序列的完整性。数据集未预设训练与评估划分,支持下游闭环成功率评估的灵活性。此外,数据涵盖2,400个语义注释,全部通过验收且无待审项,体现了高标准的标注质量控制。数据组织采用任务本地化的HDF5文件结构,支持选择性下载,极大提升了数据管理的便捷性。同时,数据集附带了针对Track4World的兼容性补丁及标准统计信息,为多场景应用提供了坚实的基础。
使用方法
此数据集主要面向模仿学习与机器人操作领域的VLA模型训练。用户可通过HuggingFace CLI进行完整或任务选择性的下载,下载后必须依据PAYLOAD_MANIFEST.json校验所有数据文件的完整性。为复现实验环境,需安装指定提交的RoboCasa环境,并应用附带的兼容性补丁,随后依据文档执行小规模的胶囊验证与身份、架构检查,以确保数据缓存构建的正确性。由于数据集未包含教师权重,用户需自行准备或运行教师模型生成联合缓存。数据集中不预设数据集划分,建议用户依据自身需求构建训练与评估集,并利用数据集提供的归一化统计信息进行数据预处理,从而顺利开展后续的模仿学习或表征学习实验。
背景与挑战
背景概述
RoboCasa-24 Atomic Success-100 RGB 256数据集由智源研究院于2024年发布,旨在为机器人操作领域的模仿学习提供高质量、细粒度的原子任务数据。该数据集基于RoboCasa v0.2模拟环境,覆盖24种原子操作任务,每个任务包含100个成功轨迹,总计2400个回合、约68万帧多视角RGB图像及几何分割掩码。核心研究问题在于构建一个具有严格标注协议、可复现且兼容多种VLA(视觉-语言-动作)模型的基准,以推动家庭场景下机器人精细操作技能的学习。该数据集以其明确的边界定义、任务局部归一化统计和开放评估协议,为模仿学习研究提供了标准化的数据基础,对机器人学习社区具有重要参考价值。
当前挑战
构建该数据集面临多重挑战:领域方面,原子任务如开门、拾取放置等需精确区分PICK与PLACE阶段,且固定资产中部分按钮缺乏独立几何体,需引入碰撞代理掩码;数据构建过程中,需确保所有语义标注通过人工审核,并保留审核决策的SHA256溯源,同时要求跨时间步和跨数据源的动作块不越界,保持数据一致性。此外,数据集的评估采用闭环成功率,未预设训练/验证划分,要求下游模型具备强泛化能力。这些挑战促使数据集不仅提供数据,还附带严格的验证协议和兼容性补丁,以保证数据质量与可复现性,助力机器人学习算法的公平比较。
常用场景
经典使用场景
RoboCasa-24 Atomic Success-100 RGB 256数据集是机器人操作与模仿学习领域的重要资源,其经典使用场景聚焦于原子技能级任务的政策学习与评估。该数据集涵盖24种原子操作任务,每种任务包含100个成功示教片段,总计2400个片段,并同步提供三视角RGB图像、几何ID分割及动作掩码,为构建视觉-运动政策提供了标准化的训练语料。研究者可采用行为克隆、离线强化学习或视觉语言动作模型等范式,在此数据上进行端到端训练,并通过闭环成功率评估算法性能,尤其适用于验证多任务学习框架对操作技能的泛化能力。
实际应用
在应用层面,该数据集为家庭服务机器人、工业装配及导航操控等现实场景提供了训练支持。其数据采集遵循标准化流程,包含仿真环境中的多相机配置和精确的几何掩码,使学习到的策略能够直接映射至物理机器人执行系统。例如,通过选取特定任务数据(如PnPCounterToCab),开发者可快速构建针对厨房场景的抓取与放置功能原型。同时,数据集提供任务局部归一化统计量与不跨片段边界的分块约束,便于实际部署中的在线决策与动作序列生成,缩短了从仿真到真实世界迁移的工程周期。
衍生相关工作
该数据集的结构与规范催生了若干衍生研究方向与工具工作。其固定契约和兼容性补丁(如Track4World补丁)被后续工作用作基准测试的固定代码版本,促进了跨研究组的可重复比较。数据集中关于动作块边界处理和语义标注的细致约定,启发了对操作技能分段预测与多视角融合方法的探索。此外,任务评估协议(闭环成功率)已成为衡量操作策略稳健性的通用标准,相关成果可嵌入更大的机器人基础模型(如视觉语言动作模型)的训练流程中,推动了从原子技能到复杂任务的层次化学习研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务