遇见数据集

VisTouch

收藏
github2026-07-31 更新2026-08-01 收录
官方服务:

资源简介:

一个大规模的同步视觉-触觉-音频机器人滑动接触数据集,包含47种材料类别,支持材质识别、跨模态检索和生成等任务,首次公开基准包含2000个时间对齐的音视频触觉三元组,来自8种代表性材料。

创建时间:
2026-07-31
原始信息汇总

VisTouch 数据集概述

基本信息

  • 全称:VisTouch - 大规模同步视觉-触觉-音频机器人滑动接触数据集
  • 来源论文:Cross-Modal Semantic Communications(IEEE Wireless Communications, 2022)
  • 数据采集方式:通过控制机器人手臂(UR3 + RH56BF3 灵巧手)按压和滑动日常材料,同时使用摄像头、麦克风和触觉力传感器记录同一接触事件
  • 许可证:数据文件 CC-BY-4.0,代码 MIT

数据规模与内容

  • 完整研究语料库:覆盖 47 种材料类别,包含百万级原始传感器观测数据(视频帧、音频波形样本和触觉测量),含 1000+ 同步的视频-音频-触觉信号对
  • 本次公开基准发布:2000 个时间对齐的音频/触觉/视频三元组,涵盖 8 种代表性材料类别:黄铜、亚麻、纸张、涤纶、丝绸、氨纶、石材、木材
  • 数据真实性:所有发布样本均为真实传感器采集数据,不包含任何合成数据
  • 接触力:3N / 6N / 9N 恒定法向力

数据模态

  • 音频:16kHz WAV 格式
  • 触觉:100Hz 力数据,CSV 格式
  • 视频:640×480@30fps AVI 格式

数据划分

  • 训练集:3N + 6N 力(1332 个样本)
  • 测试集:保留 9N 力(668 个样本)— 用于衡量跨压力泛化能力
  • 样本构成:120 个单次按压-滑动周期(segNN)+ 1880 个多尺度滑动窗口(winTNN,约 7s/8.5s/10.3s/14s)

基准任务与结果

任务 模型 关键指标 结果
材料识别(滑动) 随机森林,融合 3 模态 准确率 76.0%(随机水平 12.5%)
材料识别(周期) 随机森林,融合 3 模态 准确率 62.5%(随机水平 12.5%)
触觉超分辨率 1D CNN MSE 降低 / 相关性 −84.9% / 0.996
跨模态检索 双 1D-CNN + InfoNCE Recall@1 / @5 5% / 25%(随机水平 2.5% / 12.5%)
跨模态生成(触觉恢复) 扩张 1D CNN,声音→触觉力曲线 MAE / 相关性 0.43 / 0.80

数据质量与预处理

  • 对所有发布信号进行了自动异常筛查,修复了触觉流中罕见的物理上不可能的 ADC 故障(824 个触觉点)和音频中孤立的电爆音(18 个音频样本),其余数据与原始传感器记录逐字节一致

文件组织与下载

  • 数据文件托管在外部存储(Google Drive 和百度网盘,提取码 1234),下载后放入存储库根目录的 dataset/ 文件夹
  • 文件命名格式:VisTouch_{material}_f{force}_r{path}_v{view}_{segment}.{ext}
  • 元数据文件包括:metadata/samples.csvmetadata/sessions.csvmetadata/segments.csvmetadata/classes.json

未来计划

  • 发布剩余的 47 类材料数据
  • 增加更多滑动路径(r2r3)和摄像头视角(v2v3
  • 提供深度基线模型(频谱图 CNN、视频 Transformer、全波形生成)
搜集汇总
数据集介绍
VisTouch 数据集图片
构建方式
VisTouch数据集依托于一台配备RH56BF3灵巧手的UR3机械臂,通过控制其在不同日常材料表面进行按压与滑动,同时部署固定视角相机、麦克风与触觉力传感器,对同一接触事件进行多模态同步采集。研究团队构建了涵盖47种材料类别的百万级原始观测语料,并从中精选出8种代表性材料(黄铜、亚麻、纸张、聚酯、丝绸、氨纶、石材、木材)的2000组时间戳对齐的音视触三元组,作为首个公开基准版本。所有样本均源自真实传感器采集,不掺入任何合成数据,并依据法向接触力(3N、6N、9N)划分了训练集与测试集,以评估跨压力泛化能力。
特点
VisTouch数据集的鲜明特色在于其多模态同步性与规模优势,完整记录了机械臂滑动接触过程中的视频、音频与触觉力信号,为跨模态语义通信研究提供了坚实基础。其公开基准版本包含2000组样本,每组涵盖约7至14秒的多尺度滑动窗口,并附有细粒度的元数据标注。数据集经过严格的质量筛查,修复了微量的ADC异常与电气爆音,确保信号保真度。此外,内置的基准测试覆盖了材料识别、触觉超分辨率、跨模态检索与生成等任务,且提供的基线模型轻量易复现,为研究者提供了便捷的性能参照。
使用方法
VisTouch数据集的使用极为便捷,用户可通过Google Drive或百度网盘下载数据文件,将其置于仓库根目录下的dataset文件夹中,并遵循预设的目录结构。数据集提供了Python数据加载器,支持按材料类别、模态类型与数据集划分灵活调用,简化了数据预处理流程。用户可运行scripts目录下的脚本复现论文中的基准结果,如分类、触觉超分辨率及跨模态任务,并借助metadata/samples.csv中的样本级信息自定义实验。所有代码均遵循MIT许可,数据遵循CC-BY-4.0许可,便于学术研究与二次开发。
背景与挑战
背景概述
VisTouch数据集诞生于2022年,由李昂、魏鑫、吴丹和周良等研究者构建,旨在探索跨模态语义通信的新范式。其核心研究问题在于如何同步捕获机器人滑动接触过程中的视觉、听觉与触觉信息,以支持多模态感知与理解。该数据集利用UR3机械臂与RH56BF3灵巧手,在47种日常材料上采集了百万级的原始传感器观测,并精选出2000组涵盖8类材料的时间对齐三元组作为首个公共基准。VisTouch的发布填补了机器人触觉感知领域多模态同步数据的空白,为材料识别、触觉超分辨率及跨模态检索与生成等任务提供了标准化的评测平台,对推动具身智能与语义通信的交叉研究具有重要影响力。
当前挑战
VisTouch在构建与应用中面临多重挑战。首先,其解决的领域问题——跨模态材料识别——需融合异构信号,面对不同模态间语义鸿沟与时序同步的难题,基准中材料识别准确率仅达76%,远未饱和,凸显了特征融合与表示学习的复杂性。其次,触觉超分辨率任务需从低采样率噪声信号中恢复高频力曲线,对模型的时序建模与噪声鲁棒性提出了严苛要求。构建过程中,挑战尤为显著:需确保三种传感器在同一接触事件下的精确时间对齐,并消除硬件触发的物理异常与电噪声干扰,如修复了824个触觉ADC点与18个音频电爆声样本。此外,数据采集覆盖多材料、多力度与多时窗,如何平衡类别分布、保证跨压力泛化能力,并维持大规模数据的一致性,亦是设计中的关键难题。
常用场景
经典使用场景
VisTouch数据集的核心应用场景聚焦于机器人滑动接触过程中的多模态感知研究,其精心设计的2000组时间对齐的音视频-触觉三元组,为材料识别、触觉超分辨率、跨模态检索与生成等任务提供了标准化的评测基准。研究者可借助该数据集在受控力条件下(3N/6N/9N)探索视觉、听觉与力觉信号的融合机制,尤其适用于验证轻量级模型在跨压力泛化场景下的鲁棒性,其预定义的数据划分(训练集1332样本,测试集668样本)确保了实验的可重复性与公平性。
实际应用
在实际应用层面,VisTouch数据集可直接服务于智能机器人的精细操作能力提升,例如辅助机器人在未知环境中通过触觉与听觉反馈实时辨识物体材质,优化抓取策略。其高质量的时间对齐数据亦可用于增强现实中的触感重现、远程医疗中的力觉反馈传输,以及消费电子产品的材质自动分类功能。此外,该数据集的跨模态生成功能(由声音恢复触觉信号)为低带宽场景下的语义通信提供了创新方案,有望在工业质检、智能家居等领域落地。
衍生相关工作
基于VisTouch数据集,研究者已衍生出多项经典工作:一是多模态融合的材料识别框架,通过随机森林与深度特征结合实现76%的滑移准确率,成为基线参考;二是基于一维卷积神经网络的触觉超分辨率模型,显著提升低频采样的力曲线重建质量;三是利用InfoNCE损失的跨模态检索系统,在音-触检索任务上达到随机基线两倍以上的性能;四是基于扩张卷积的声音到触觉生成模型,实现了0.80的相关性恢复,为无触觉传感器的场景提供了替代方案。这些工作共同验证了数据集在多任务上的适用性,并为其后续扩展提供了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务