Deform360
收藏数据链接:
官方服务:
资源简介:
Deform360是一个用于可变形物体研究的大规模多视角视觉触觉数据集,在布朗大学的BRICS圆顶中捕获。完整数据集包含:13个类别的198个日常可变形物体、1,980次机器人交互、215.7小时数据、约2,330万帧、41个同步720p RGB摄像头提供360度覆盖,以及配备四个16×32传感器流的双手机械手触觉夹爪。
Deform360 is a large-scale multi-view visual-tactile dataset for deformable object research, captured in the BRICS Dome at Brown University. The full dataset includes 198 daily deformable objects across 13 categories, 1,980 robot interaction sessions, 215.7 hours of recorded data, approximately 23.3 million frames, 41 synchronized 720p RGB cameras providing 360-degree coverage, and a dual-hand robotic tactile gripper equipped with four 16×32 sensor streams.
创建时间:
2026-06-27
原始信息汇总
数据集概述
Deform360 是一个大规模多视角触觉数据集,专注于可变形物体研究,在布朗大学BRICS穹顶中采集。
核心规模
- 物体: 198个日常可变形物体,涵盖13个类别
- 交互: 1,980次机器人交互,总计215.7小时,约2,330万帧
- 相机: 41台同步720p RGB相机,实现360°全覆盖
- 触觉: 基于UMI的双臂触觉夹爪,提供4个16×32传感器流
数据内容与格式
- RGB图像:
(H,W,3)uint8,RGB顺序 - 相机内参:
K = [[fx,0,cx],[0,fy,cy],[0,0,1]] - 相机外参: 相机到世界坐标 (
c2w),遵循OpenCV坐标系(+x右,+y下,+z前) - 畸变系数:
[k1,k2,p1,p2] - 深度: 度量相机-z深度,HDF5格式存储为uint16毫米,0表示无效
- 时间戳: Unix微秒
- 触觉数组:
(T,16,32)float32,无量纲响应值
数据标注与工具
提供以下标注的读取和处理工具(不含模型训练代码):
- 物体掩码:
mask_refined.h5,(T,H,W)bool/uint8 - 度量深度:
rendered_depth.h5,(T,H,W)uint16毫米 - 密集跟踪: 速度场
tracking/vel.h5(T,H,W,3),可见性visibility.h5(T,H,W)bool - RGB-D几何: 度量深度、RGB、内参、外参,支持反投影、投影、多视角融合、体素选择
- 重建标注:
.splat或.ply格式的高斯/点云读取 - 机器人/夹爪位姿: 安全状态格式
robot.npz,支持验证、检测、PnP、插值、平滑、开口距离
数据下载
数据托管于Hugging Face:brownu/deform360
数据集许可
MIT许可证。
搜集汇总
数据集介绍
构建方式
Deform360数据集在布朗大学BRICS穹顶内构建,利用41台同步720p RGB摄像机实现360度全覆盖采集,结合基于UMI的双机械臂触觉夹爪,每个夹爪配备4个16×32传感器流。数据集包含198个日常可变形物体,涵盖13个类别,通过1,980次机器人交互操作,累积约215.7小时、约2,330万帧的多模态数据。采集过程中,每台摄像机独立时钟,通过校准选择帧数最少的摄像机作为锚点,对齐其他摄像机最近帧并校正图像,触觉数据则通过减去基线中值、峰值归一化等步骤处理后与相机时间戳对齐。
特点
该数据集的核心特点在于其大规模、多视角与触觉融合的独特设计。41台摄像机提供的360度覆盖确保了可变形物体在任意姿态下的完整三维观测,双机械臂触觉夹爪则同步捕获高分辨率触觉信号,实现了视觉与触觉模态的精细化对齐。数据集附带了经过精心校准的相机内外参、对齐时间戳以及标准化后的触觉响应数组,并提供了通用模型无关的注释接口,支持掩码、深度、稠密跟踪、点云重建等多种下游任务,同时避免了与具体学习框架的耦合,显著提升了数据的复用灵活性。
使用方法
使用者可通过pip安装提供的Python工具包,利用命令行工具`deform360-download`从Hugging Face仓库按需下载指定物体数据。随后使用`deform360-undistort`对相机图像进行去畸变与多视角对齐,生成时间同步的校正视频与校准文件;再通过`deform360-process-tactile`处理触觉数据,得到归一化后与相机帧对齐的触觉张量。最终,通过`MultiViewDataset`和`TactileDataset`类加载器,开发者能够便捷地以帧索引访问同步的RGB图像、相机参数与触觉数据,结合提供的几何与注释工具开展可变形物体的建模研究。
背景与挑战
背景概述
可变形物体的感知与操控是机器人学与计算机视觉领域中极具挑战性的前沿课题,其难点在于物体形态的连续变化、材料特性的多样性以及多模态感知数据的高效融合。为此,布朗大学、哥伦比亚大学与麻省理工学院的研究团队于2026年联合构建了Deform360数据集,并被欧洲计算机视觉会议(ECCV 2026)收录。该数据集依托布朗大学BRICS穹顶采集系统,利用41台全方位分布的同步摄像机与基于UMI的双臂触觉夹爪,对涵盖13个类别的198种日常可变形物体进行了1980次机器人交互采集,累计时长超过215小时,帧数达2300余万张。研究团队旨在为可变形世界模型的构建提供大规模、多视角、多模态的基准数据,推动基于学习的物体动态建模与机器人操作领域的发展。
当前挑战
Deform360数据集所应对的核心挑战在于可变形物体操作世界模型的学习与泛化。由于物体变形具有高度非线性和材料依赖性,传统刚体建模方法难以适用,而现有数据集在物体多样性与传感模态丰富性上均显不足。在构建过程中,团队面临多重挑战:首先,41台摄像机各自独立时钟,需实现亚帧级的时间同步与高精度空间校准;其次,触觉传感器信号包含复杂噪声与基线漂移,需设计鲁棒的标准化流程以提取有效触觉响应;此外,海量多模态数据的高效存取、跨模态对齐以及后续大规模模型训练的计算资源调度,均对系统的工程实现提出了严苛要求。
常用场景
经典使用场景
在计算机视觉与机器人学交叉领域,Deform360数据集为可变形物体的感知与建模提供了前所未有的多视角触觉-视觉同步基准。其经典使用场景集中于以数据驱动的方式构建可变形世界模型:研究者利用41台同步720p摄像头提供的360度全覆盖影像,结合双机械臂末端四组16×32触觉传感器流,对绳索、布料等198种日常可变形物体进行1,980次机器人交互过程的密集记录。该数据集尤其适合训练和评估基于4D高斯泼溅、神经辐射场等技术的动态三维重建算法,能够从多视角视频与触觉信号中学习物体的形变动力学,为后续交互式推理奠定基础。
衍生相关工作
基于Deform360的独特架构,一系列衍生工作已在视觉跟踪、动态场景表示及触觉反馈模拟等领域涌现。该数据集的设计理念催生了将4D高斯泼洒与CoTracker结合的高效形变流估计算法,以及利用触觉先验引导不可见区域形变推理的创新方法。研究社区还依托其严密的对齐管道,开发了跨模态时间戳匹配工具包与无损触觉编码方案,这些工具被进一步回馈至更广泛的机器人数据集制作流程中。更重要的是,Deform360所确立的触觉-视觉标准化文件契约(如HDF5掩膜与二进制高斯飞溅格式),已成为后续同类数据集构建时参考的事实标准。
数据集最近研究
最新研究方向
在机器人操控与计算机视觉的交叉领域,可变形物体的感知与建模一直是极具挑战的核心难题。Deform360数据集以大规模多视角视触觉数据为突破口,系统性地覆盖了198种日常可变形物体,并借助41台360度环绕相机与双机械臂触觉夹爪,实现了对物体变形过程的高分辨率时空同步捕捉。该数据集的最新研究方向聚焦于构建可变形世界模型,即将三维重建、密集跟踪与触觉反馈有机融合,驱动基于4D高斯泼溅、运动跟踪器和基础分割模型的端到端学习框架。其深远意义在于,为机器人执行精细化、自适应性的软体操作任务提供了标准化的数据基石,有望显著提升机器人在非结构化环境中与可变形物体交互的鲁棒性与泛化能力。
以上内容由遇见数据集搜集并总结生成



