遇见数据集

Touch3D

收藏
arXiv2026-06-10 更新2026-06-12 收录
数据链接:
官方服务:

资源简介:

Touch3D是由上海交通大学与蚂蚁集团联合构建的大规模三维视觉-触觉数据集,涵盖505个真实物体与超过2万次触觉接触样本。该数据集通过高精度三维扫描与GelSight Mini触觉传感器采集,融合了物体几何形态、材质纹理及多场景视觉数据,数据总量约700小时标注工时,覆盖餐饮、穿戴、工具等六类生活场景。其创建过程采用可移动采集系统与人工标注流程,确保了像素级触觉-视觉对齐质量,主要应用于机器人感知、跨模态对齐与物理交互理解,旨在解决触觉信号局部接触与全局场景对齐的学术空白。

Touch3D is a large-scale 3D vision-touch dataset jointly developed by Shanghai Jiao Tong University and Ant Group. It covers 505 real-world objects and over 20,000 tactile contact samples. Collected via high-precision 3D scanning and GelSight Mini tactile sensors, this dataset integrates object geometric shapes, material textures, and multi-scenario visual data. With a total of approximately 700 hours of annotation work, it encompasses six daily life scenarios including catering, wearables, and tools. Its construction adopts a mobile acquisition system and manual annotation workflow, ensuring pixel-level tactile-visual alignment quality. Primarily applied to robot perception, cross-modal alignment and physical interaction understanding, this dataset aims to address the academic gap in the alignment between local tactile contact signals and global scene contexts.

创建时间:
2026-06-10
搜集汇总
数据集介绍
Touch3D 数据集图片
构建方式
触觉感知作为人与环境交互的核心模态,在机器人操作与物理智能领域具有不可替代的地位。然而,现有触觉数据集多局限于全尺度图像对齐,忽视了局部接触与视觉区域间的精细对应关系。为突破这一瓶颈,研究者构建了包含505个真实物体、共计20,025次触觉接触的3D视觉-触觉数据集Touch3D。数据集构建采用可移动式采集平台,集成GelSight Mini触觉传感器与RGB相机,通过结构化光扫描仪获取高精度三维网格(最小点距0.2毫米),并辅以深度相机记录第三方视角。操作员手动旋转传感器支架完成配对数据采集后,利用自研标注系统对接触位置、触觉材质进行像素级标注与质量校验,最终形成包含6类场景、18种材质的多模态数据资源。
特点
Touch3D数据集在触觉学习领域展现出多项突破性特质。首先,其规模为当前最大的3D视觉-触觉数据集,涵盖505个真实物体与20,025次离散接触,远超现有同类数据集。其次,数据集创新性地实现了像素级触觉-视觉对齐,通过将标注的接触点映射至多视角渲染图像中的对应像素位置,建立了局部接触与全局场景的细粒度对应关系。在数据多样性方面,Touch3D覆盖厨房、服饰、玩具等6类均衡场景,每物体最多包含4种材质,平均标注材质数达1.47,远优于OBJECTFOLDER REAL的单一材质设定。此外,采集过程引入主动人体动力学特性,所获接触数据聚焦于物体功能性区域,为局部到全局对齐能力评估提供了高质量基准。
使用方法
Touch3D数据集为视觉-触觉对齐研究提供了标准化评测框架。使用时应首先基于DINOv2 ViT-Large模型对本地裁剪块(包含触觉、视觉或融合模态)与全局物体图像进行特征提取。通过对比学习、DSCMR或DAR等跨模态损失函数,训练模型在局部-全局检索任务中实现精确匹配。评估指标涵盖k-NN准确率(物体分类)、平均精度均值(材质分类)以及倒角距离与F分数(几何一致性)。研究者将数据按4:1比例划分为训练集与测试集,并可复用OBJECTFOLDER REAL作为跨传感器泛化性测试集。此外,数据集支持的线性探测与注意力可视化工具,可用于分析模型对功能性区域的聚焦程度,从而指导触觉骨干网络与融合策略的优化。
背景与挑战
背景概述
Touch3D数据集由上海交通大学、蚂蚁集团等机构的研究人员于2026年创建,旨在弥补视觉-触觉学习中局部与全局对齐的缺失。当前触觉学习多聚焦于图像级预训练或与全局图像的粗略对齐,忽略了触觉信号与物体局部接触区域的精准匹配。基于神经科学中视觉-触觉双向跨模态映射的发现,研究团队开发了一套可移动的数据采集系统,以505个真实物体和超过20,000次触觉接触构建了迄今最大规模的3D视觉-触觉数据集,为细粒度触觉表征学习奠定了坚实基础,推动了机器人操作与物理智能领域的发展。
当前挑战
该数据集面临的核心挑战包括:一、领域问题层面,触觉信号对应物体局部接触,现有方法将其与整体图像对齐导致多义性问题,亟需实现局部视觉块与触觉信息的细粒度匹配,以支持从局部触觉推断全局物理属性;二、构建过程中,真实世界多感官数据采集耗时巨大(超700小时),且需手工标注接触位置与材料标签,繁杂且易出错;此外,不同触觉传感器间存在域迁移,缺乏统一触觉骨干网络,限制了跨传感器泛化与大规模触觉学习的可扩展性。
常用场景
经典使用场景
Touch3D数据集的核心经典使用场景在于推动视觉与触觉模态在局部-全局层面的精细对齐学习。传统触觉学习往往将触觉信号与整张物体图像对齐,忽略了触觉数据本质上是局部接触的物理表征。Touch3D通过提供超过2万次真实物体接触的触觉数据、对应的高质量3D扫描形状以及精确标注的接触位置像素,为研究者构建了一个前所未有的平台,用于探究从局部触觉斑块到全局物体理解的映射关系。在此框架下,该数据集主要用于训练和评估模型是否能够从微小的接触区域提取并恢复出物体的几何形状、材质类别乃至全局语义信息。
衍生相关工作
Touch3D数据集的发布已在多模态感知领域引发了一系列重要的衍生研究工作。基于该数据集,研究者进一步探索了如何利用触觉约束来指导视觉特征学习,提出了诸如Patch Tac + DAR、Patch Vis + CL等一系列视觉-触觉斑块对齐方法,实验证明了局部斑块约束相较于整图对齐在注意力和泛化能力上的显著优势。这些工作不仅在横向对比中揭示了简单对比学习与精心设计的跨模态损失在不同模态下的适用性差异,还启发了后续将触觉信息融入3D生成任务(如Tactile DreamFusion)以及跨传感器触觉表征统一(如AnyTouch系列)的研究方向,推动了整个触觉学习生态系统的迭代与完善。
数据集最近研究
最新研究方向
Touch3D数据集聚焦于视触觉局部-全局对齐的前沿研究方向,通过构建包含505个真实物体与20,025次触觉接触的大规模3D视触觉数据集,突破了传统粗粒度图像级对齐的局限。该数据集结合Vis-Tac全息匹配基准与VTPA(视触觉局部对齐)方法,从局部触觉接触中推断全局物理属性,显著提升了物体分类、材料识别与几何匹配的性能。研究揭示了触觉引导视觉特征向细粒度物理理解演进的关键潜力,并为机器人精细操作、虚拟现实及多模态物理智能提供了重要支撑。当前核心挑战在于跨传感器泛化、数据规模扩展及统一触觉骨干网络的构建,Touch3D为此奠定了坚实基础。
相关研究论文
  • 1
    Tac-DINO: Learning Vision-Tactile Features with Patch Alignment上海交通大学; 蚂蚁集团; 上海创新研究院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务