遇见数据集

depth_cache_recover194_vggt_clean

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集是一个深度缓存(depth cache),名为recover194_vggt_clean,用于机器人操作任务中的深度估计。它对应数据集takeru01/task1_1_5_rgb_recover_up_down_trim_194ep,只能用于相同 episode 结构和帧长度的数据集。缓存结构:主干网络为 vggt,腕部主干网络为 da3,非度量(metric=False),网格尺寸为 8×14(高度×宽度),步长为 2,包含 194 个 episode(索引 0 到 193),共 190,542 帧。相机分为静态相机(camera_front 和 camera_top)和腕部相机(camera_left_wrist 和 camera_right_wrist),其中 role=none 的相机格子全零且不参与注入。缓存包含 4 个通道:第 0 通道(CH_VALUE)为静态相机中盘面相对高度(米)的 95% 分位数,或腕部相机中指尖相对 delta(米)的 5% 分位数;第 1 通道(CH_OCC)为格子内漂浮或指尖附近像素的比例;第 2 通道(CH_SPREAD)为格子内深度范围(q95-q05,米);第 3 通道(CH_VALID)为有效像素率(0-1),注意 0 表示缺失而非盘面高度为 0。预计算过程中产生了若干警告,包括 camera_front 深度尺度帧间波动 74mm、平面内点率仅 38%、左右腕部相机的 metric 申报与实际尺度偏差超过 30%(分别约 0.42 和 0.43 倍),提示 ROI 可能包含手臂或夹具,以及近距 metric 不可靠。历史记录显示内参哈希、规格哈希、标定方法为 roi-median,缩放因子为 1.3685,基于真实深度相机 camera_front 的 1.24 米参考。

This dataset is a depth cache named recover194_vggt_clean for depth estimation in robot manipulation tasks. It corresponds to the dataset takeru01/task1_1_5_rgb_recover_up_down_trim_194ep and can only be used with datasets of the same episode structure and frame length. The cache structure: backbone vggt, wrist backbone da3, non-metric (metric=False), grid size 8×14 (height×width), stride 2, contains 194 episodes (indices 0 to 193), total 190,542 frames. Cameras include static cameras (camera_front and camera_top) and wrist cameras (camera_left_wrist and camera_right_wrist), where cameras with role=none have all-zero grids and are not involved in injection. The cache has 4 channels: channel 0 (CH_VALUE) is the 95th percentile of relative disk height (meters) for static cameras or the 5th percentile of fingertip relative delta (meters) for wrist cameras; channel 1 (CH_OCC) is the proportion of pixels floating or near fingertips within a grid cell; channel 2 (CH_SPREAD) is the depth range within a grid cell (q95-q05, meters); channel 3 (CH_VALID) is the valid pixel rate (0-1), where 0 indicates missing data rather than zero disk height. Precomputation warnings include: camera_front depth scale inter-frame fluctuation of 74mm, in-plane point ratio only 38%, left/right wrist cameras reported metric vs actual scale deviation exceeding 30% (approximately 0.42 and 0.43 times), suggesting ROI may include arms or grippers, and close-range metric being unreliable. History records: intrinsics hash, specification hash, calibration method roi-median, scaling factor 1.3685, based on real depth camera camera_front at 1.24m reference.

创建时间:
2026-09-06
原始信息汇总

数据集概述

基本信息

该数据集名为 depth_cache/recover194_vggt_clean,是由 cable_depth 生成的细胞格(cell grid)缓存,用于训练时通过 --depth-cache 参数传入。它服务于数据集 takeru01/task1_1_5_rgb_recover_up_down_trim_194ep

使用限制

该缓存通过 (episode_index, frame_index) 进行索引,因此仅适用于具有相同剧情构成和相同长度的数据集,不能用于其他数据配置。

技术规格

  • backbone: vggt
  • wrist_backbone: da3
  • metric: False
  • grid: [8, 14](即 gh, gw)
  • stride: 2
  • episodes: 194,范围 (0, 193)
  • frames: 190542

相机配置与角色

相机 角色
camera_front static
camera_top static
camera_left_wrist wrist
camera_right_wrist wrist

注意:角色为 none 的相机的格网全为零,不参与注入。

通道定义

通道 含义
0 CH_VALUE static: 盘面相对高度[m]的95%分位数 / wrist: 指尖相对Δ[m]的5%分位数
1 CH_OCC 单元格内“浮在盘面上 / 在指尖附近”的像素比例
2 CH_SPREAD 单元格内深度宽度 q95−q05 [m]
3 CH_VALID 有效像素率 (0-1)。0 表示缺失,不代表“盘面上(d=0)”

预计算警告

  • camera_front 深度尺度不稳定:帧间标准差摆动约 74 mm,虽已通过 gauge 归一化吸收,但可能因 ROI 中手臂占比过多导致。
  • camera_front 平面内点率低:仅有 38% 内点率,表明 --roi 可能偏离板面,或 ROI 中包含手臂/夹具。
  • camera_left_wrist 尺度失真:该相机声明为 metric backbone,但与实测 a0 对比,尺度仅 ×0.42(偏差超过30%),表明近距下 metric 声明不可靠,建议对其他相机也进行实测验证。
  • camera_right_wrist 尺度失真:同样声明为 metric backbone,但与实测对比尺度为 ×0.43(偏差超过30%),建议进行实测交叉验证。

数据来源与处理参数

  • intrinsics_sha256: fece1ac6bb2b109a
  • spec_sha256: 4af9fc9d1891e59d
  • gauge: roi-median
  • scale: {scale: 1.3684628464669712, method: z_true, z_true_cam: camera_front=1.24}
搜集汇总
数据集介绍
depth_cache_recover194_vggt_clean 数据集图片
构建方式
立足于机器人操作与具身智能领域对深度先验高效复用的需求,该数据集以细胞网格缓存的形式封装了深度图的结构化表示。其构建依托于对应的RGB数据集task1_1_5_rgb_recover_up_down_trim_194ep,通过对每帧深度图施加固定网格划分,在纵向与横向分别采用8与14的网格分辨率,并设置步长为2,将原始稠密深度转化为紧凑的网格化特征。缓存以回合索引与帧索引为键,覆盖194个回合、总计190542帧,囊括静态的camera_front、camera_top以及腕部视角camera_left_wrist与camera_right_wrist,并依据相机角色对网格进行差异化填充,非相关相机对应零值区域并排除于注入流程之外。
特点
该数据集呈现出显著的网格化、多通道与角色感知特征。每个网格单元编码四个通道:通道0记录静态相机下盘面相对高度的95百分位数或腕部相机下指尖相对位移的5百分位数;通道1量化单元内悬浮或近指像素的占比;通道2刻画单元内深度值的四分位距;通道3给出有效像素比率,且明确区分缺失与真实零深度。由于缓存以回合与帧索引对齐,其仅适用于 episode 构成与长度完全一致的数据集。此外,预计算过程中暴露的深度尺度帧间波动、平面内点率偏低及腕部相机度量尺度偏差等警告,亦构成该缓存重要的质量标识。
使用方法
使用该缓存时,需在训练脚本中通过 --depth-cache 参数传入对应路径,从而在训练过程中直接读取预先计算的网格深度特征。由于索引依赖回合与帧的对应关系,调用方须确保所用数据集与 takeru01/task1_1_5_rgb_recover_up_down_trim_194ep 在回合划分与帧序列长度上严格一致,否则将导致索引错位。对于角色标记为 none 的相机,其网格全为零且不参与特征注入。使用者应留意预计算警告中提示的深度尺度不稳定与度量尺度偏差问题,必要时结合实测数据进行校验,以保障深度先验注入的可靠性。
背景与挑战
背景概述
在机器人操作与具身智能研究领域,深度信息的高效表征与复用日益成为提升策略学习效率的关键。depth_cache_recover194_vggt_clean数据集由研究团队构建,对应于194个回合的操作任务数据,采用VGGT作为主干网络,结合DA3手腕主干,将深度观测压缩为栅格化缓存,涵盖前视、顶视与双手腕四路相机的通道化深度特征。该数据集以回合索引与帧索引为检索键,为基于深度缓存的策略训练提供了结构化、可复现的中间表征,在一定程度上缓解了大规模深度数据重复前向计算的开销问题。
当前挑战
其所面对的领域问题在于,如何将多视角、多尺度的原始深度观测转化为兼具几何保真与计算效率的可学习表征,同时规避传统栅格缓存与具体回合结构强绑定的泛化瓶颈。构建过程中的核心挑战集中于深度尺度的帧间不稳定性与度量可信度:前视相机深度尺度帧间波动达74毫米,平面内点率仅38%,表明感兴趣区域易受手臂与夹具干扰;双手腕相机虽声明度量属性,实测尺度却分别偏差至0.42与0.43倍,揭示近距度量声明难以信赖。这些因素共同对缓存的几何一致性与跨数据集迁移能力构成显著制约。
常用场景
经典使用场景
在机器人操作策略学习领域,深度缓存作为预计算的空间先验,常被用于缓解在线深度估计的计算负担与噪声干扰。depth_cache_recover194_vggt_clean数据集通过为194个训练回合的每一帧提供网格化深度统计,使策略网络能够直接查询目标区域的高度分布、占用率与深度散布,而无需在训练循环中反复进行密集的深度推理。该缓存以(episode_index, frame_index)为索引,与特定数据集绑定,适用于固定回合结构与帧长的模仿学习流程,尤其适合作为--depth-cache参数注入到基于体素或网格表征的策略模型中。
实际应用
在实际机器人操作任务中,该数据集可服务于桌面抓取、装配等需要精确高度感知的场景。训练时,策略模型以缓存网格作为辅助输入,能够快速判断板面各区域的可抓取性、腕部附近是否存在悬浮物体以及深度测量的可信程度。由于缓存预先计算并存储,训练过程无需重复运行深度估计骨干网络,显著降低显存占用与迭代时间。同时,缓存中标注的无效像素率与警告信息可指导数据采集者调整ROI或相机布局,避免因手臂遮挡或尺度漂移导致的策略退化,从而在真实机器人系统上实现更稳健的闭环控制。
衍生相关工作
该深度缓存衍生自RGB recover数据集,并支撑了以VGGT为骨干的深度估计与策略学习工作。其网格化统计思路启发了后续一系列基于缓存的空间先验方法,例如将深度分位数、占用率作为额外通道输入到扩散策略或Transformer策略中,以减少对在线深度传感器的依赖。此外,缓存中记录的尺度漂移与平面内点率警告,推动了近距腕部相机度量标定与ROI自适应裁剪的研究。相关经典工作包括在模仿学习中引入预计算深度特征、利用网格统计进行可操作区域分割,以及通过缓存一致性校验提升多相机深度融合的鲁棒性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务