遇见数据集

Deform360

收藏
arXiv2026-07-07 更新2026-07-07 收录
数据链接:
官方服务:

资源简介:

Deform360是由布朗大学、哥伦比亚大学等机构联合创建的大规模多视角视觉触觉数据集,旨在为可变形物体世界建模提供高质量的基准数据。该数据集囊括了198种日常物体,包含1,980个交互序列,总计超过2,150万帧图像和215.7小时的多视角视频,并同步采集了双工触觉信号,数据规模极为庞大。其构建过程通过41个环绕摄像头和配备触觉的UMI夹爪系统,捕获了物体全局运动和接触引起的局部形变,并利用无标记三维跟踪流程生成了高保真的几何与运动标注。该数据集主要应用于机器人操控领域,旨在系统评估和比较二维视频与三维粒子世界模型在可变形物体动力学预测、接触检测及机器人规划任务中的性能,以解决当前因缺乏多样、大规模真实世界数据而难以深入理解模型优劣的核心挑战。

Deform360 is a large-scale multi-view visual-tactile dataset jointly created by Brown University, Columbia University and other institutions, aiming to provide high-quality benchmark data for modeling deformable object worlds. This dataset covers 198 daily objects, contains 1,980 interaction sequences, with a total of more than 21.5 million image frames and 215.7 hours of multi-view video, and simultaneously collected duplex tactile signals, resulting in an extremely large data scale. During its construction, 41 surround-view cameras and a tactile-equipped UMI gripper system were used to capture the global motion of objects and local deformations caused by contacts, and a markerless 3D tracking pipeline was utilized to generate high-fidelity geometric and motion annotations. This dataset is mainly applied in the field of robotic manipulation, aiming to systematically evaluate and compare the performance of 2D video and 3D particle world models in tasks including deformable object dynamics prediction, contact detection and robotic planning, so as to address the core challenge that it is currently difficult to deeply assess the strengths and weaknesses of models due to the lack of diverse, large-scale real-world data.

创建时间:
2026-07-07
原始信息汇总

数据集概述

Deform360 是一个大规模多视角触觉数据集,专注于可变形物体,用于支持2D和3D世界模型的基准测试。

核心数据规模

  • 物体数量: 198个日常可变形物体,涵盖17个类别。
  • 交互序列: 1,980个交互序列。
  • 总时长: 累计215.7小时的多视角视频。
  • 总帧数: 约2,330万帧。
  • 原始视频: 74,850个。
  • 录制规格: 720p分辨率,30 FPS,同步捕捉。

传感器配置

  • 视觉: 41个环绕相机,提供360°全覆盖。
  • 触觉: 双手触觉夹爪(UMI平台)。

物体分类(按材料响应)

  • 1D 线性物体: 绳索、电缆、电线,具有不同的刚度和厚度。
  • 2D 薄壳物体: 布料、织物、纸张,包括多种纺织品、气囊和薄壳。
  • 3D 体积物体: 毛绒玩具、泡沫、填充物,表现出较大的形状变化。

关键特性

  • 标注: 通过无标记物视觉触觉跟踪流程,生成密集的3D粒子标注。
  • 几何重建: 使用逐帧3D高斯泼溅(3D Gaussian Splatting)恢复高保真几何形状。
  • 跟踪: 利用CoTracker3进行2D跟踪,并通过渲染深度反投影并融合41个视角的3D点。
  • 优化: 结合物理信息的细化过程,包含形状、刚性、平滑度和触觉损失。
  • 触觉信号: 同步的触觉传感器提供法向压力接触提示,在视觉遮挡时约束粒子运动。

基准测试结论

  • 未来预测(已见物体,未见交互片段): ParticleFormer 在所有报告的指标上表现最佳。
  • 未见物体上的视觉指标: 预训练的Cosmos模型在重建方面视觉优势最强,但可能偏离指令动作。

开源与许可

  • 许可证: 数据集和完整流程(捕捉、重建、感知和世界模型基线)均以MIT许可证发布。
  • 数据获取: 通过Hugging Face平台(huggingface.co/datasets/brownu/deform360)访问。

作者与引用

  • 作者: Hongyu Li, Wanjia Fu, Xiaoyan Cong, Zekun Li, Binghao Huang, Hanxiao Jiang, Xintong He, Yiqing Liang, Rao Fu, Tao Lu, Srinath Sridhar, Kevin A. Smith, George Konidaris, Yunzhu Li。
  • 机构: 布朗大学、哥伦比亚大学、麻省理工学院。
  • 引用: 已收录于ECCV 2026。
搜集汇总
数据集介绍
Deform360 数据集图片
构建方式
Deform360数据集的构建依托于一套精心设计的同步触觉-视觉采集系统,由41台环绕视角相机和配备双手机械手的触觉传感器组成,旨在捕获可变形物体在操作过程中的全局运动与局部接触形变。数据采集涵盖了198种日常物品,包括1D线状物、2D薄壳物和3D体积可变形物,共计1,980段交互序列,每段序列均记录了机器人末端执行器的6D位姿与开合度。基于多视图校准与逐帧3D高斯泼溅重建,研究团队开发了一种无标记3D追踪流水线,将2D追踪结果提升至3D空间,并融合触觉信号优化粒子轨迹,最终生成高保真度粒子标注及动态几何表示。
使用方法
Deform360数据集可用于多种可变形物体动力学的研究任务,包括接触预测、世界模型基准测试以及机器人规划。研究者可利用同步触觉数据训练模型,从视觉观测中预测接触事件。数据集提供的高保真粒子轨迹与动态几何表示,支持训练和评估基于3D粒子的动力学模型(如ParticleFormer、PGND)和基于2D视频的生成模型(如Cosmos)。此外,通过模型预测控制框架,可将学习到的动力学模型部署于真实机器人系统,实现可变形物体的目标导向操作。数据集公开了训练代码与评估指标,便于复现与扩展实验。
背景与挑战
背景概述
Deform360数据集诞生于机器人操作领域中一个长期悬而未决的难题:如何精确建模可变形物体的物理动态。由布朗大学、哥伦比亚大学与麻省理工学院的研究团队于2025年联合创建,该数据集旨在弥合现有基准在物体多样性、感官丰富度与真实世界保真度之间的显著鸿沟。研究核心聚焦于两大世界模型范式的系统对比——基于2D像素空间的视频预测模型与基于3D几何空间的粒子动力学模型,揭示其在不同数据规模下的结构先验与可扩展性权衡。通过囊括198种日常物品、1980段交互序列及41台环绕相机与双手触觉抓爪的协同记录,Deform360不仅提供了超过215小时的密集视触觉观测,更以无标记三维跟踪管道产出的高保真粒子轨迹,为可变形物体动力学研究树立了全新的基准标杆。
当前挑战
可变形物体的动力学建模面临双重挑战。其核心领域难题在于物体状态空间的理论无限维度——接触引发的局部形变常被末端执行器或物体自遮挡所掩盖,而触觉传感虽能观测隐匿交互,却缺乏与视觉模态的深度耦合;当前世界模型或依赖结构先验在低数据场景保持稳定,或借助规模扩展实现泛化,但二者优劣尚无系统评估。构建过程中,团队需攻克多视角标定、41路高帧率视频与触觉信号的亚毫秒同步,以及重自遮挡下的持续追踪;即便采用3D高斯泼溅与多视图2D至3D提升管道,重度塑性材料对局部刚性与平滑性假设的违背,以及触觉传感器仅测法向压力而无法识别微滑移的现实局限,仍对数据保真度构成显著约束。
常用场景
经典使用场景
在机器人操控与感知研究领域,Deform360数据集为可变形物体的动力学建模提供了前所未有的规模化真实世界数据支撑。其最经典的使用场景在于构建和评估可变形物体的世界模型,研究者可借此系统性地对比基于二维像素空间的视频预测模型与基于三维几何空间的粒子动力学模型。通过该数据集提供的多视角视觉与触觉同步观测,人们能够精确捕捉变形体在交互过程中的全局运动与局部接触形变,从而深入剖析不同范式在结构先验与可扩展性之间的权衡关系。
解决学术问题
该数据集有效解决了可变形物体动力学建模长期面临的数据稀缺与标注困难等核心学术难题。以往研究受限于物体类型单一、缺乏多视角覆盖或依赖合成数据,难以评估模型的真实泛化能力。Deform360收录了198件日常物品与1980个交互序列,配合41台环绕相机和双机械手触觉传感器,提供了超过215小时的高保真观测数据。这一资源使得学术界得以系统性地评估现有世界模型在帧泛化、场景泛化与物体零样本泛化等不同难度层级上的表现,揭示出结构化先验与数据规模之间的互补机理。
实际应用
在实际应用层面,Deform360展现了将学得动力学模型迁移至真实机器人规划任务的巨大潜力。研究者在完全不同的实验环境中,利用该数据集训练的物理孪生模型(PhysTwin)结合模型预测控制框架,成功操控多种可变形物体朝向目标状态演化。这一零样本部署的成功验证了数据集所蕴含的动力学知识具有良好的跨环境适应性。此外,数据集同步记录的触觉信号为接触预测任务提供了宝贵监督信息,启发了仅依赖视觉线索推断隐蔽接触状态的技术路径,这对精细操控任务具有重要实用价值。
数据集最近研究
最新研究方向
Deform360数据集聚焦于可变形物体动态建模的前沿方向,通过大规模多视角触觉数据,系统性地对比二维视频模型与三维粒子模型在变形物体世界模型中的表现。研究揭示了结构化先验与可扩展性之间的关键权衡:在数据稀疏场景下,三维粒子模型借助物理先验展现出卓越的动态捕捉能力;而二维视频模型凭借海量预训练,在零样本泛化至全新物体类别时表现更优。该工作为机器人操控中的变形物体世界模型提供了坚实基准,并展示了其在真实机器人模型预测控制中的应用潜力,推动了可泛化、物理可解释且可扩展的机器人世界模型研究。
相关研究论文
  • 1
    Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models布朗大学; 哥伦比亚大学; 麻省理工学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务