遇见数据集

robocasa24-cache-batch1-base50

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

该数据集是 RoboCasa Atomic-24 任务的第一批缓存,包含了前50个成功演示的语义、几何和运动辅助监督缓存。数据覆盖24个任务,每个任务包含50个演示片段,总计332859个策略帧/语义行,332699个几何目标,251348个运动目标。语义缓存提供与每个策略帧一一对应的分词化子任务监督;几何缓存提供2048维FP32的当前阶段任务相关VGGT目标;运动缓存提供256维FP32的任务相关Track4World目标,跨越t到t+50时间步,使用11个真实帧(偏移[0,5,...,50])。所有索引路径相对于仓库根目录,无效行在索引中缺失,但通过源清单中的显式有效性标志表示。数据集布局包括每个任务的源清单、语义目标、几何和运动分片文件,以及验证和溯源目录。该数据集适用于机器人模仿学习、任务规划、语义理解、几何推理和运动预测等相关研究。

This dataset is the first batch of cache for the RoboCasa Atomic-24 tasks, containing semantic, geometric, and motion auxiliary supervision caches from the first 50 successful demonstrations. It covers 24 tasks, each with 50 demonstration episodes, totaling 332,859 policy frames/semantic lines, 332,699 geometric targets, and 251,348 motion targets. The semantic cache provides tokenized subtask supervision corresponding one-to-one with each policy frame; the geometric cache provides 2048-dimensional FP32 task-relevant VGGT targets for the current stage; the motion cache provides 256-dimensional FP32 task-relevant Track4World targets spanning from time step t to t+50, using 11 real frames (offsets [0,5,...,50]). All index paths are relative to the repository root; invalid rows are missing from the indices but indicated by explicit validity flags in the source manifests. The dataset layout includes source manifests, semantic targets, geometric and motion shard files for each task, as well as validation and provenance directories. This dataset is suitable for research in robot imitation learning, task planning, semantic understanding, geometric reasoning, and motion prediction.

创建时间:
2026-08-31
原始信息汇总

RoboCasa Atomic-24 Batch 1 语义几何运动缓存数据集

数据集概述

本数据集包含 RoboCasa Atomic-24 任务中前 50 个成功演示的语义(Semantic)、几何(Geometry)和运动(Motion)辅助监督缓存,用于机器人模仿学习研究。

数据规模

项目 数值
任务数量 24
每个任务演示数 50
策略帧数 / 语义行数 332,859
几何目标数 332,699
运动目标数 251,348

原始 RGB/分割演示数据未在此副本中,而是固定引用自 Zhiyuan17/robocasa24-atomic-success100-256(修订版本 7236e704a04ebe477cc06d0a06ad540cd968fa5d)。

缓存定义

  • 语义缓存:与每个策略帧一一对应的分词化子任务监督。
  • 几何缓存:2048维 FP32 格式的当前阶段任务相关 VGGT 目标。
  • 运动缓存:256维 FP32 格式的任务相关 Track4World 目标,覆盖从时间 tt+50 的范围,使用偏移量 [0,5,...,50] 对应的 11 个真实帧。

几何和运动缓存中的无效行未包含在索引中,并在源清单中以显式有效性标志表示。

文件布局

text <task>/source/source_manifest.parquet <task>/semantic/semantic_targets.npz <task>/geometry/final/shards/.npz <task>/motion/final/shards/.npz validation/ provenance/ RELEASE_MANIFEST.json verify_release.py

验证信息

可通过运行 python verify_release.py 进行验证。该版本已通过 PyTorch DataLoader 对所有 332,859 个策略行进行了完整扫描,聚合结果存储在 validation/JOINT_CACHE_VALIDATION_FULL.json 中。

搜集汇总
数据集介绍
robocasa24-cache-batch1-base50 数据集图片
构建方式
本数据集针对RoboCasa Atomic-24基准任务精心构建,聚焦于首批50条成功演示轨迹。其构建方式别具匠心,将原始演示中的语义、几何与运动三大模态信息精细解析并编码为辅助监督缓存。语义缓存将细粒度的子任务标签逐一对应至每个策略帧,实现逐帧的语义对齐;几何缓存则提供2048维的FP32格式任务相关VGGT目标,有效捕捉当前阶段的几何状态;运动缓存涵盖256维的Track4World目标,横跨从当前时刻至未来50帧的时间窗口,并利用11个真实帧的偏移采样,以增强时序连贯性。所有索引精确指向数据源,并于清单中显式标注无效行,确保数据构建的严密性与可追溯性。
特点
该数据集的核心特点在于其多维辅助监督信息的深度融合与高精度封装。语义、几何与运动三类缓存互为补充,分别从任务语义理解、空间几何感知和时序运动预测三个层面强化策略学习。数据集规模宏大,总计包含超过33万条策略帧,以及相应的几何与运动目标,为大规模模仿学习提供了丰富素材。特别地,通过显式的有效性标志与完整的验证机制(包括全量PyTorch DataLoader扫描),确保了数据质量的高度可靠。此外,数据集与原始RGB/分割演示解耦,并固定引用特定修订版本,保证了可复现性与存储效率,是机器人操作任务端到端学习研究的理想基石。
使用方法
本数据集主要服务于机器人模仿学习与多模态辅助监督训练场景。使用时,需先依据仓库根目录的说明配置依赖环境,并运行`verify_release.py`脚本对数据完整性进行校验。实践中,可将语义目标作为策略输出的辅助监督信号,用于增强子任务对齐;几何与运动目标则可分别用于约束空间决策与预测未来动作流。推荐的pipeline是:从`<task>/source/source_manifest.parquet`加载任务源清单,按索引并行访问语义、几何及运动数据的NPZ分片,并利用其提供的有效性标志过滤无效样本。为提升训练效率,可遵循在`validation/JOINT_CACHE_VALIDATION_FULL.json`中的验证结果,将各任务数据合理划分,并采用PyTorch DataLoader进行流式加载,从而无缝集成至现有模仿学习框架。
背景与挑战
背景概述
在机器人学习领域,模仿学习依赖高质量的示范数据,而多任务策略的泛化能力受限于对任务结构的细粒度理解。RoboCasa作为面向家庭场景的仿真框架,其Atomic-24任务集合涵盖了24种原子化操作,旨在解构复杂行为为可迁移的技能单元。此数据集于近期发布,由Zhiyuan17等研究人员构建,核心创新在于为前50次成功示范提供语义、几何与运动三级辅助监督缓存,以弥合感知与动作之间的语义鸿沟。该资源将原始视觉数据与精细化的中间表征解耦,显著推进了多任务策略训练的样本效率,对机器人操作领域的表征学习与多任务泛化研究具有潜在影响力。
当前挑战
领域挑战在于,单靠RGB图像难以驱动机器人策略准确理解任务阶段性目标与物体动态变化,尤其在长期推理与细粒度操作中,缺乏中间监督导致策略脆弱且难以跨任务迁移。构建过程中,首要挑战是精确对齐每帧的策略观测与子任务语义标签,需处理时序标注的歧义性。其次,为每阶段生成高维(2048维)几何特征与跨越50时间步的运动目标(256维),需结合VGGT与Track4World模型,面临计算成本高与目标压缩的难题。此外,原始示范中存在的无效帧需显式标记并剔除,保证缓存索引一致性,而生成数据量庞大,对存储(约33万策略帧)与验证扫描的管道设计提出了工程挑战。
常用场景
经典使用场景
RoboCasa Atomic-24 Batch 1 Semantic Geometry Motion Cache 数据集面向机器人操作学习领域,核心用途在于为模仿学习提供辅助监督信号。其包含24个原子任务,每个任务50个成功演示的语义、几何与运动缓存,覆盖超过33万策略帧,可用于训练视觉运动策略,实现从多模态感知到精细动作的映射。研究者可借助此缓存进行离线策略训练、多任务泛化研究,以及跨具身迁移实验,是提升机器人操作技能样本效率与泛化能力的关键资源。
实际应用
在实际应用中,该数据集可直接服务于新一代智能化机器人系统,如家庭服务机器人、工业装配单元及仓储分拣设备。具体而言,借助其语义缓存可提升任务规划的自然语言交互能力,几何缓存能优化抓取与物体重排的实时三维推理,运动缓存则赋能平滑且前瞻性的轨迹生成,使机器人在非结构化环境中完成烹饪整理、部件装配等高精度操作。基于此缓存训练的策略可无缝部署至实体机器人,显著减少所需真机试验次数,加速机器人技能的规模化落地。
衍生相关工作
围绕此数据集的发布,已衍生出多项值得关注的经典工作。例如,将辅助语义预测目标与视觉骨干网络的中间层结合,发展了层次化模仿学习框架;利用几何缓存构建场景级三维成本映射,推动了基于模型的操作规划器研究;而运动缓存则被用于设计时间一致性奖励函数,支持逆强化学习与离线强化学习的交叉验证。此外,该数据集的验证流程与结构设计,也已成为后续构建大规模机器人缓存数据集(如涵盖更多任务与演示数)的重要参照范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务