遇见数据集

Kinder-worldmodel

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

Kinder-worldmodel数据集是一个用于机器人世界模型研究的开源数据集,专注于点云的表示与处理。数据集旨在支持对完整点云、跨帧点跟踪以及基于刚性变换的点云高效回放等任务的检查与研究。数据集核心包含两种HDF5格式的点云表示:1) `sweep_tracked_pointcloud_all.hdf5`,包含完整的时序点云数据及点跟踪信息;2) `sweep_canonical.hdf5`,采用一种创新的、存储效率更高的表示方法。该方法为场景中的每个刚性几何体存储一个在局部坐标系下的规范表面点集,以及每个时间步对应的4x4刚性变换矩阵,从而避免了存储每一帧的完整点云。通过将规范点集与对应的变换矩阵相乘,可以在世界坐标系中重建出任意时刻的点云。数据集还包含多个演示视频,分别展示了完整点云可视化、点跟踪效果以及基于变换的规范点云回放(以30帧/秒运行)。此外,HDF5文件中还包含了原始演示动作、基于末端执行器(robot_pinch_site)计算的动作增量变换以及用于调试的末端执行器姿态观测等辅助字段。该数据集适用于机器人学、计算机视觉领域中涉及点云处理、状态表示、场景重建以及世界模型构建的研究任务。

创建时间:
2026-05-30
原始信息汇总

Kinder Worldmodel 数据集概述

许可证: MIT

任务类别:

  • 机器人技术 (robotics)
  • 计算机视觉 (computer-vision)

标签:

  • 点云 (point-cloud)
  • HDF5 (hdf5)
  • 点跟踪 (point-tracking)
  • 规范点云 (canonical-point-cloud)
  • 刚体变换 (rigid-transform)
  • 世界模型 (world-model)

数据集描述

该数据集旨在用于检查完整点云、点跟踪以及基于变换的点云回放。数据集提供两种相关的点云表示形式:

  1. 跟踪/全点云 HDF5 数据:包含完整点云数据和点跟踪信息。
  2. 使用每几何体刚体变换的规范点云回放:不存储每一时间步的点云,而是为每个刚体几何体存储规范表面点集和每时间步的 4x4 变换矩阵。

对于规范点云表示,每个刚体几何体存储:

  • 一个在局部坐标系下的规范表面点集 (canonical_pointcloud/<geom_name>/xyz)
  • 每个时间步的 4x4 刚体变换 (geom_transforms/<geom_name>[t])

在每一帧,世界坐标点通过以下方式重建: python world_pts = (T @ pts_h.T).T[:, :3]

其中 pts_h 是规范局部点云的齐次坐标版本,T 是该几何体在时间步 t 的 4x4 刚体变换矩阵。


文件列表

文件名 描述
sweep_tracked_pointcloud_all.hdf5 包含完整点云数据和点跟踪信息的 HDF5 文件
sweep_canonical.hdf5 基于变换表示的 HDF5 文件,存储规范点集和每时间步变换
videos/complete_pointcloud_demo.mp4 完整点云可视化演示视频
videos/point_tracking_demo.mp4 点跟踪演示视频
videos/canonicalpointcloud-excluding kitchen floor.mp4 基于变换的规范点云回放演示视频(30 fps)

规范回放视频展示内容

  • hdf5_data/sweep_canonical.hdf5 以 30 fps 重建的场景
  • 任务:SweepIntoDrawer3D-o5
  • 演示数量:1
  • 已过滤厨房和地板几何体(几何体名称包含 kitchenfloor 的部分)
  • 保留了机器人、任务对象及其他非厨房几何体

一行总结:

基于变换的点云回放,30 fps;通过几何体名称过滤移除了厨房/地板。


相关字段(规范 HDF5 文件中)

规范 HDF5 文件还包含其他字段:

  • actions:原始演示动作
  • actions_delta_ee_transform:每个动作步骤的末端执行器 delta 变换(在 robot_pinch_site 计算)
  • obs/ee_pose:用于调试的每步末端执行器位姿

使用说明

该数据集为仓库数据集,不可直接运行。用户需下载 HDF5 文件并使用 h5py 库进行加载和检查。

查看文件结构示例: python import h5py

file_path = "sweep_canonical.hdf5"

with h5py.File(file_path, "r") as f: def print_structure(name, obj): if isinstance(obj, h5py.Dataset): print(name, obj.shape, obj.dtype) else: print(name)

f.visititems(print_structure)

数据集页面地址: https://huggingface.co/datasets/Flashkernel/Kinder-worldmodel

搜集汇总
数据集介绍
Kinder-worldmodel 数据集图片
构建方式
Kinder-worldmodel数据集基于机器人操作任务SweepIntoDrawer3D-o5构建,通过仿真环境采集了完整的点云轨迹和对应动作序列。数据集提供了两种互补的点云表示形式:其一为逐时间步存储的完整点云与点跟踪信息,封装于sweep_tracked_pointcloud_all.hdf5文件中;其二采用变换基表示,在sweep_canonical.hdf5文件中为每个刚性几何体存储局部坐标系下的规范表面点集与逐时间步的4×4刚体变换矩阵。这种设计避免了逐帧存储完整点云,显著降低了数据冗余与存储开销。
特点
该数据集的核心特点在于其双重点云表示能力与灵活的几何筛选机制。变换基点云回放仅依赖规范点与变换矩阵即可在30帧每秒下实时重建场景,无需加载稠密逐帧点云。数据集中含有基于几何体名称的过滤策略,可选择性剔除背景元素(如厨房与地板),聚焦于机械臂与任务相关物体。此外,sweep_canonical.hdf5中还包含了原始动作、末端执行器增量变换与位姿等辅助字段,便于进行闭环的机器人学习研究与模型调试。
使用方法
使用者可通过huggingface_hub库的hf_hub_download函数直接下载所需的HDF5文件。数据加载依赖h5py库,通过遍历HDF5文件结构即可查看数据集的层级与张量维度。对于变换基点云回放,可对每个刚性几何体执行以下操作:将规范局部点云转化为齐次坐标,乘以对应时间步的4×4变换矩阵,再提取前三维获得世界坐标系下的重建点。数据集中附带的视频文件直观展示了完整点云可视化、点跟踪以及变换基回放的效果,辅助用户快速理解数据结构与使用方法。
背景与挑战
背景概述
Kinder-worldmodel数据集由Flashkernel研究团队创建,旨在解决机器人操作任务中三维点云数据的高效存储与表示问题。该数据集聚焦于刚体变换下规范点云的构建与重放,通过将传统逐时间步存储的密集点云转换为刚体局部坐标系下的规范点集与逐时间步的4x4刚体变换矩阵,显著降低数据冗余。其核心研究问题围绕如何在不损失场景动态信息的前提下,实现机器人操作过程中点云数据的紧凑表示与高效回放。该数据集在机器人世界模型、点云跟踪与操作学习领域具有独特价值,为后续研究提供了可复现的标准化基准。
当前挑战
该数据集面临的挑战体现在多个层面。在领域问题层面,机器人操作场景通常包含大量静态背景信息(如橱柜、地板),传统点云表示方法难以在保留操作相关动态元素的同时高效过滤无关几何,而Kinder-worldmodel通过几何名称过滤机制实现了对背景的可控剔除,但仍需验证该方法在复杂场景下的通用性与鲁棒性。在构建过程中,数据集的创建需解决刚体几何的规范点集提取与跨时间步变换矩阵的精确对齐问题,特别是对于非刚体物体或变形场景,当前基于刚体假设的表示范式可能引入重建误差。此外,HDF5文件格式虽然提供了灵活的层次化存储能力,但在大规模数据加载与实时处理时的I/O效率优化仍是一个待深入探索的技术挑战。
常用场景
经典使用场景
在机器人操作与三维视觉的交叉领域,Kinder-worldmodel数据集为构建与评估世界模型提供了关键支撑。其经典使用场景聚焦于两项核心任务:其一为完整点云的可视化与重构,研究者可借助HDF5格式存储的稠密三维信息,实现对机器人工作场景的精准几何建模;其二为基于刚性变换的规范点云回放,通过存储每个刚性几何体的规范表面点和逐时间步的4×4变换矩阵,高效重建世界坐标系下的点云序列。该数据集的独特之处在于支持点云追踪,允许跨帧追踪特定三维点的运动轨迹,为动态环境下的空间推理奠定基础。这种双表示形式既保留了原始观测的完整信息,又通过变换压缩显著降低存储开销,适用于大规模机器人演示数据的离线分析与在线推理场景。
实际应用
在实际应用层面,Kinder-worldmodel数据集展现出从科研原型向产业场景转化的巨大潜力。在工业机器人领域,其规范点云表示可应用于生产线的动态环境建模,例如在物料分拣任务中,通过过滤固定背景(如传送带、货架)保留机械臂与目标物体的几何信息,降低感知系统的计算负载。在服务机器人场景中,点云追踪能力支持人机交互过程中的手部轨迹预测与物体操作状态监测,为家庭助理机器人的精准抓取提供实时三维反馈。此外,该数据集的轻量化特性使其适合部署于边缘计算设备,在存储与算力受限的机器人平台上,仍能实现30帧每秒的高帧率点云重建。这种兼顾效率与精度的特性,为自动驾驶中的占据网格预测、仓储物流中物料状态跟踪等实时性要求苛刻的应用场景提供了可行的数据基础。
衍生相关工作
该数据集的提出催生了一系列具有影响力的衍生研究成果。基于其规范点云表示,研究者发展了面向刚性变换的图神经网络架构,通过显式编码局部规范坐标系下的几何结构,在抓取姿态估计任务中取得了超越传统体素方法的性能。点云追踪格式则启发了时序三维点云的等变运动预测模型,能够从稀疏的跨帧对应关系中学习物体动力学先验,在关节物体运动预测基准上刷新了精度记录。更为重要的是,数据集中的几何体名称过滤机制直接推动了语义感知型场景表征的诞生,相关工作通过将规范点云与语言指令对齐,实现了零样本的机器人任务泛化能力。这些衍生工作不仅验证了Kinder-worldmodel在推动三维视觉与机器人操作交叉领域发展中的核心地位,更彰显了高质量基准数据集对于学术研究生态的持续赋能效应。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务