遇见数据集

dreamlake-hug

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

dreamlake-hug 是 HUG(Human Universal Grasping)数据集的一个 15 个录制演示的子集,由纽约大学 Lerrel Pinto 实验室创建,采用 CC-BY-4.0 许可证。该数据集专为 DreamLake dataset-viz 的 folder 格式重新打包,原始数据为 Python pickle 的 tar 分片,每个 payload 被转换为标准格式:JPEG 或 16 位 PNG 帧序列、COCO 关键点以及 Parquet 点轨迹。每个录制对应一个被抓取的物体,均来自训练分片 0。数据集中没有手部视觉信息,因为每个录制是从第一人称视角观察物体接近过程,每个帧携带相同的最终抓取标签(grasp_index)。HUG 的任务是从场景中预测抓取,因此 MANO 骨架是标签而非检测结果。COCO 关键点是将该抓取重投影到每个帧的二维坐标,而 3D 姿态轨迹则是同一标签在每帧相机坐标系下的三维表示。该数据集适用于 egocentric grasp prediction、手部姿态估计、物体交互分析等任务。

dreamlake-hug is a subset of the HUG (Human Universal Grasping) dataset containing 15 recorded demonstrations, created by the Lerrel Pinto lab at New York University, licensed under CC-BY-4.0. The dataset is repackaged for the DreamLake dataset-viz folder format; original data is Python pickle tar shards, with each payload converted to standard formats: JPEG or 16-bit PNG frame sequences, COCO keypoints, and Parquet point trajectories. Each recording corresponds to a grasped object, all from training shard 0. There is no hand visual information, as each recording is from a first-person perspective observing the object approach, and each frame carries the same final grasp label (grasp_index). The HUG task is to predict grasps from the scene, so MANO skeletons are labels rather than detections. COCO keypoints are the reprojection of that grasp to 2D coordinates in each frame, while 3D pose trajectories are the 3D representation of the same label in the camera coordinate system of each frame. The dataset is suitable for tasks such as egocentric grasp prediction, hand pose estimation, and object interaction analysis.

创建时间:
2026-08-17
原始信息汇总

dreamlake-hug 数据集详情

基本信息

  • 许可证:CC-BY-4.0
  • 标签:dreamlake、dataset-viz、egocentric、grasping、rgbd、mano

数据来源

该数据集是 kevinywu/1m-hugsHUG: Human Universal Grasping,NYU Lerrel Pinto 实验室,CC-BY-4.0,arXiv:2606.17054grasping.io)的15个录制的演示切片,重新打包以适应 DreamLake dataset-viz 的 folder 格式。

数据内容

  • 数据格式:原始数据为 tar 分片的 Python pickle 文件,本数据集将其重新发布为以下标准格式:
    • JPEG / 16-bit PNG 帧序列
    • COCO 关键点
    • Parquet 点轨迹
  • 数据组织:每个被抓取对象对应一个 episode,来自训练分片 shard 0。
  • 处理方式:除格式转换外,未对原始数据进行额外修改。

标注与任务说明

  • 手部情况:所有帧中均无可见的手部,每个录制为对物体的第一人称(egocentric)接近过程。
  • 标注类型:每个录制包含一个 grasp_index 标注,即最终的抓取标签。HUG 的任务是从场景中预测抓取动作。
  • MANO 骨架:作为标签而非检测结果。
  • COCO 关键点:是抓取标签在各帧中的重投影。
  • 3D 姿态轨迹:是同一标签在各帧相机坐标系下的表示。

构建信息

  • 构建脚本:packages/viz/scripts/build-hug-demo.py(在 viz-workspace 云环境中执行)
  • 探测脚本:scripts/hug-probe.py
搜集汇总
数据集介绍
dreamlake-hug 数据集图片
构建方式
该数据集源自纽约大学Lerrel Pinto实验室发布的HUG(Human Universal Grasping)数据集,原始数据以tar分片形式存储Python pickle文件。dreamlake-hug作为其演示切片,从训练分片0中抽取15个录制片段,每个片段对应一个被抓取物体。构建过程在云端通过packages/viz/scripts/build-hug-demo.py脚本完成,将原始载荷重新编码为JPEG/16位PNG帧序列、COCO关键点格式及Parquet点轨迹,除格式转换外未改动任何内容,探针事实记录于scripts/hug-probe.py。
特点
该数据集聚焦于自我中心视角下的抓取预测任务,所有录制均为朝向物体的接近过程,画面中不出现手部。每帧均标注同一个最终抓取事件,以grasp_index标识,MANO骨架作为标签而非检测目标。COCO关键点是将该抓取重投影至各帧的结果,3D姿态轨迹则提供每帧相机坐标系下的同一标签。数据涵盖RGBD模态,采用CC-BY-4.0许可,适用于以场景预测抓取的研究。
使用方法
使用者可通过DreamLake数据集可视化平台的folder格式直接加载该数据集,借助内置工具浏览帧序列、关键点与点轨迹。由于数据已转换为JPEG、16位PNG、COCO关键点和Parquet等通用格式,可直接用于训练抓取预测模型,将场景图像映射至MANO抓取标签。研究时可结合grasp_index理解每段录制的唯一抓取事件,并利用3D姿态轨迹进行相机坐标系下的姿态监督。
背景与挑战
背景概述
伴随具身智能与机器人操作研究的纵深推进,第一人称视角下的抓取预测逐渐成为贯通视觉感知与动作规划的关键命题。dreamlake-hug源自纽约大学Lerrel Pinto实验室构建的大规模抓取数据集HUG(Human Universal Grasping),系其经DreamLake可视化格式重制而成的15段演示切片,遵循CC-BY-4.0许可,相关论文见arXiv:2606.17054。该数据集以每帧场景为输入、以未来抓取姿态为标注,旨在推动从自我中心视觉中推断抓取意图的研究,为跨物体、跨场景的通用抓取建模提供了可复现的基准资源。
当前挑战
该数据集所应对的核心难题在于从无手可见的自我中心画面中预测尚未发生的抓取动作,模型须仅凭场景上下文与物体外观推断合理的抓握构型,这对视觉表征与动作先验的耦合提出了严峻考验。构建层面,源数据以Python pickle分片封装,需在不改变语义的前提下转码为JPEG、16位PNG、COCO关键点与Parquet轨迹等标准格式,并确保MANO骨架作为标签而非检测目标被准确重投影至逐帧相机坐标系,标注一致性、格式兼容性与跨分片对齐均构成显著挑战。
常用场景
经典使用场景
在具身智能与自我中心视觉的交汇领域,dreamlake-hug数据集构筑了一个精炼而富有表现力的实验平台。该数据集汇聚了十五段以第一人称视角捕捉的接近—抓取片段,每一帧均以JPEG或16位PNG图像序列呈现,并同步装配了COCO格式的关键点标注与Parquet点轨迹。经典使用方式在于从视觉场景中预测未来的抓取姿态:模型需在无手部可见的条件下,依据物体与场景的上下文,推理出将要在抓取时刻执行的MANO手部构型,从而将视觉理解与动作预测紧密耦合。
解决学术问题
该数据集直面自我中心抓取预测中长期存在的标注稀缺与异构难题。传统研究依赖双目或多视角视频进行手部姿态估计,而HUG范式将抓取视为从场景直接推断的标签,无需在图像中检测手部,从而规避了手部遮挡与运动模糊带来的标注噪声。它所解决的核心学术问题包括:如何从单目第一人称视角学习可泛化的抓取先验,如何融合深度与RGB信息以提升三维姿态回归的鲁棒性,以及如何以统一格式弥合原始Python pickle与主流视觉工具链之间的鸿沟,为可复现研究奠定数据基础。
衍生相关工作
作为1m-hugs数据集的精炼切片,dreamlake-hug本身即是一项衍生性工作,其构建脚本与探针工具进一步催生了若干后续研究。基于该数据格式,研究者得以在DreamLake可视化平台上开展大规模抓取预测基准测试,并衍生出跨物体泛化、多模态融合以及自监督抓取表征学习等经典课题。其标签即抓取的设计理念亦被后续工作借鉴,用于探索从被动视频中学习主动操作策略,进而与模仿学习、世界模型等方向形成交叉,持续拓展自我中心抓取研究的边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务