遇见数据集

tactile-video-pretrain-nc

收藏
Hugging Face2026-06-08 更新2026-06-09 收录
官方服务:

资源简介:

Tactile Video Pretrain非商业版本数据集是一个专门聚合不允许商业使用的多模态触觉视频数据集,作为MIT许可主数据集的补充。该数据集整合了Baihu-VTouch数据集的一个子集,涵盖4个不同的机器人操作任务,分布在两种机器人平台上:轮式人形机器人D-WHEEL(执行废品回收和堆叠盘子任务)和手持式双夹爪智能终端PIKA(执行尺子入袋和路由器线缆任务)。数据集规模在1千到1万个样本之间,具体包含至少758个任务片段。每个片段提供丰富的多模态数据:包括4个GelSight式触觉传感器的视频(240×240分辨率)、3个RGB摄像头视频(手部摄像头848×480,头部摄像头640×480)、2个红外摄像头视频(848×480灰度)、16位精度的深度视频,以及Parquet格式记录的关节状态和动作数组。数据以分层目录结构组织,并附带相机内参外参和元数据。该数据集专为机器人学、视频分类和特征提取任务设计,特别适用于触觉-视觉多模态预训练和自监督学习。数据集采用CC-BY-NC-SA-4.0许可,要求署名、仅限非商业使用,且衍生作品必须采用相同许可。使用需引用VTouch++相关论文。

The Tactile Video Pretrain Non-Commercial Version dataset is a specialized aggregation of multimodal tactile video datasets that are not permitted for commercial use, serving as a supplement to the main dataset under MIT license. This dataset currently integrates a subset of the Baihu-VTouch dataset, covering 4 different robot manipulation tasks across two robot platforms: the wheeled humanoid robot D-WHEEL (performing waste recycling and plate stacking tasks) and the handheld dual-gripper smart terminal PIKA (performing ruler insertion into a bag and router cable tasks). The dataset scale ranges from 1,000 to 10,000 samples, specifically including at least 758 task episodes. Each episode provides rich multimodal data: including videos from 4 GelSight-style tactile sensors (240×240 resolution), 3 RGB camera videos (hand camera 848×480, head camera 640×480), 2 infrared camera videos (848×480 grayscale), 16-bit precision depth videos, as well as joint state and action arrays recorded in Parquet format. The data is organized in a hierarchical directory structure and comes with camera intrinsic and extrinsic parameters and metadata. This dataset is designed for robotics, video classification, and feature extraction tasks, particularly suitable for tactile-visual multimodal pretraining and self-supervised learning. The dataset adopts the CC-BY-NC-SA-4.0 license, requiring attribution, non-commercial use only, and derivative works must use the same license. Usage requires citation of the VTouch++ related paper.

创建时间:
2026-06-04
原始信息汇总

数据集概述

数据集名称:Tactile Video Pretrain — non-commercial sibling (yxma/tactile-video-pretrain-nc)

许可证:CC-BY-NC-SA-4.0(非商业用途、署名、相同方式共享)

任务类别:机器人技术、视频分类、特征提取

标签:触觉、视觉触觉、GelSight、视频、预训练、自监督、非商业、Baihu-VTouch、OpenLoong

数据规模:1K < n < 10K(样本数)

数据集描述:该数据集是 yxma/tactile-video-pretrain 的非商业版,聚合了来自 Baihu-VTouch 的 GelSight 风格触觉视频源,其许可协议不允许商业使用。目前已包含 4 个任务(涉及 2 种机器人平台)的子集。


数据格式

每个 episode 存储在 videos/baihu_vtouch/<task>/<robot>/<episode_id>/ 目录下,包含以下文件:

文件 说明
bimanual.mp4 紧凑预览视频(顶部为手部相机画面,底部为4个触觉传感器画面)
tactile_left_l.mp4 左手指左侧触觉视频,240×240,H.264 CRF 18
tactile_left_r.mp4 左手指右侧触觉视频,240×240,H.264 CRF 18
tactile_right_l.mp4 右手指左侧触觉视频,240×240,H.264 CRF 18
tactile_right_r.mp4 右手指右侧触觉视频,240×240,H.264 CRF 18
cam_hand_left.mp4 左手腕相机视频,848×480,H.264 CRF 18
cam_hand_right.mp4 右手腕相机视频,848×480,H.264 CRF 18
cam_head.mp4 头部相机视频,640×480
head_ir_left.mp4 头部左侧红外视频,848×480,灰度,H.264 CRF 18
head_ir_right.mp4 头部右侧红外视频,848×480,灰度,H.264 CRF 18
head_depth.mkv 头部深度视频,FFV1 无损,16位灰度,灰度16le
joints.parquet 关节状态和动作数组
metadata.json 元数据
params/ 相机内参和外参

注意:原始 Baihu-VTouch H5 文件未镜像到 Hugging Face,如需获取,请从 ModelScope 官方页面 直接下载。


任务预览(已处理)

数据集当前包含来自 4 个 Baihu-VTouch 任务的处理 episode,具体如下:

  1. 废物回收(Waste Recycling)— D-WHEEL 平台(轮式人形机器人)

    • 已处理 273 个 episode
  2. 叠盘子(Stack Plates)— D-WHEEL 平台

    • 已处理 84 个 episode
  3. 尺子放入袋中(Ruler into Pouch)— PIKA 平台(手持式智能终端)

    • 已处理 261 个 episode
  4. 路由器线缆操作(Router Cable)— PIKA 平台

    • 已处理 140 个 episode

双手机器人布局(每 episode 预览)

每个 episode 的 bimanual.mp4 文件采用以下布局:

+-------------------+-------------------+ | 左手腕相机画面 | 右手腕相机画面 | ← 每个手腕的场景RGB画面 +--------+----------+--------+----------+ | 左手指左侧| 左手指右侧| 右手指左侧| 右手指右侧| ← 4个触觉传感器 +--------+----------+--------+----------+

顶部宽行显示每个手腕相机视角的工作空间,下方4个区域为每个手指两侧的 GelSight 触觉传感器画面。


上游 H5 文件架构

每个 Baihu-VTouch episode 的原始 HDF5 文件结构如下(本数据集已压缩为上述格式):

<task>/<robot_config>/<episode_id>.h5 ├── cameras/{head,hand_left,hand_right}/color/data # (T,) JPEG 字节 ├── cameras/head/{depth,ir_left,ir_right}/data # (T,) 字节/数组 ├── tactile/{hand_left,hand_right}/{left,right}/data # (T,) PNG 字节(凝胶图像) ├── joints/state/{arm,effector,robot,waist}/... # (T, K) float32 ├── joints/action/... ├── parameters/camera/{head,hand_left,hand_right}.json ├── metadata.json └── timestamp # (T,) int64

每个 Baihu-VTouch episode 运行约 400-1500 帧,采样率为 30 Hz(对应 几秒到约 50 秒的运动)。


机器人平台

机器人 描述 本仓库中的任务
D-WHEEL 轮式人形机器人(青龙级) 废物回收、叠盘子
PIKA 手持式双夹爪智能终端 尺子放入袋中、路由器线缆操作

两个平台均采用相同的 4 触觉 + 3 相机 + 16位深度 + 2 红外 + 关节状态架构,便于跨平台预训练。


快速开始

python from huggingface_hub import snapshot_download import glob, os, pyarrow.parquet as pq

root = snapshot_download("yxma/tactile-video-pretrain-nc", repo_type="dataset") episodes = glob.glob(os.path.join(root, "videos/baihu_vtouch///*")) print(f"{len(episodes)} episodes available locally")

ep = episodes[0] tactile_left = os.path.join(ep, "tactile_left_l.mp4") depth = os.path.join(ep, "head_depth.mkv") # FFV1 16-bit joints = pq.read_table(os.path.join(ep, "joints.parquet"))


仍在处理中的内容

完整的 Baihu-VTouch 数据集共 17 TB,涵盖 29 个任务。当前正在后台下载更多任务(按数据量从小到大处理),转换为上述格式,并每 15 分钟自动推送。请稍后查看更新。


引用

bibtex @article{hua2026vtouch, title = {VTouch++: A Multimodal Dataset with Vision-Based Tactile Enhancement for Bimanual Manipulation}, author = {Hua, Qianxi and Li, Xinyue and Yan, Zheng and Li, Yang and Zhang, Chi and Li, Yongyao and Liu, Yufei}, journal = {arXiv preprint arXiv:2604.20444}, year = {2026} }

搜集汇总
数据集介绍
tactile-video-pretrain-nc 数据集图片
构建方式
在触觉感知与机器人操作研究领域,高质量的多模态数据集对于推动自监督预训练技术的发展至关重要。本数据集作为非商业用途的配套版本,整合了源自Baihu-VTouch项目且遵循CC-BY-NC-SA-4.0许可协议的触觉视频资源。其构建过程严谨细致,选取了两类机器人平台(轮式人形机器人D-WHEEL与手持双夹爪智能终端PIKA)上四个典型操作任务的子集,包括废品回收、餐盘堆叠、直尺装袋与网线布设。每个操作片段都按照统一的层次化目录结构组织,包含四路240×240分辨率的触觉视频(左右手各两通道)、三路RGB场景相机流、两路近红外灰度图像、16位无损深度视频以及关节状态与动作序列的Parquet文件,同时保留了相机内外参JSON元数据。
特点
本数据集最显著的特点在于其多模态触觉感知的完整性与跨平台一致性。所有片段均同步记录四路GelSight式触觉传感器的凝胶接触图像,与手部、头部场景相机及深度传感器形成立体感知架构,为触觉-视觉联合表征学习提供了原生对齐的数据模态。其独特的双指双侧触觉布局(每指左右两个传感区域)使模型能够捕捉更精细的抓取接触信息。数据集规模虽控制在一千至一万个片段之间,但每个片段持续400至1500帧(30Hz采样),覆盖了数秒至五十秒的完整操作轨迹,保证了时间维度的丰富性。此外,两个机器人平台采用完全相同的传感器配置与数据格式,使跨平台的自监督预训练成为可能,显著提升了学习特征的可迁移性。
使用方法
使用本数据集进行自监督预训练时,研究者可通过HuggingFace Hub的snapshot_download函数便捷地将全部视频及元数据下载至本地。每个操作片段目录下均提供独立的H.264编码触觉视频(CRF 18高质量压缩)、FFV1无损深度视频及Parquet格式的关节数据表。推荐采用PyAV或OpenCV库读取视频帧,结合torchvision与PyTorch构建数据管道,将四路触觉图像与场景图像作为并行输入进行时空特征提取。对于需要更高精度原始数据的场景,可以从上游ModelScope站点获取未压缩的HDF5格式完整片段。该数据集特别适用于VideoMAE、SimCLR等对比学习框架,也支持作为下游操作技能学习任务(如抓取姿态预测、接触力估计)的预训练基础。
背景与挑战
背景概述
触觉感知在机器人灵巧操作中扮演着不可或缺的角色,然而长期以来缺乏大规模、多模态的触觉视频数据集,制约了自监督预训练范式在该领域的发展。由Hua、Li等研究人员于2026年创建的Tactile Video Pretrain (NC sibling)数据集,汇集了基于GelSight原理的触觉视频数据,核心研究问题在于为双臂机器人操作任务提供丰富的触觉与视觉联合信息,以推动机器人对物理交互的深度理解。该数据集整合了来自Baihu-VTouch的四个代表性任务,涵盖D-WHEEL轮式人形机器人和PIKA手持双夹爪终端两种平台,原始数据规模达17TB,为触觉预训练研究提供了不可多得的非商业资源,对机器人学、视频分类及特征提取等领域具有重要影响。
当前挑战
该数据集所面对的领域挑战在于,触觉数据的高维度与低采样率使得从原始触觉视频中提取稳定的表征极为困难,尤其在不同机器人平台间迁移时,触觉传感器物理特性与任务差异增大了自监督学习的难度。构建过程中面临多重技术瓶颈:上游Baihu-VTouch的H5原始文件单集约970MB,若直接镜像至HuggingFace需处理约700GB数据,受限于LFS速率限制而无法直接上传;同时需将4路触觉、3路彩色相机、16位深度图、2路红外相机及关节状态等多模态数据统一编码为H.264视频和Parquet表格格式,并兼顾压缩效率与质量平衡,显著提升了数据加工与存储的复杂度。
常用场景
经典使用场景
触觉视频预训练数据集(Tactile Video Pretrain, NC)专为机器人触觉感知与多模态学习任务而设计,其核心应用场景聚焦于基于GelSight类触觉传感器的视频级自监督预训练。该数据集汇集了Baihu-VTouch项目中涵盖四种精细操作任务(如垃圾分类、叠放盘子、尺子入袋及路由器绕线)的触觉视频片段,每条数据均包含四路触觉图像流、多角度视觉相机、16位深度图及关节状态信息,为跨平台、跨任务的触觉表征学习提供了标准化的视频级训练资源。借助其统一的传感器布局与格式规范,研究者可直接利用该数据集进行视频分类、特征提取及自监督预训练等经典工作,从而推动触觉感知模型在机器人操作中的泛化能力提升。
衍生相关工作
围绕该数据集已衍生出多项具有影响力的经典工作,其中最为突出的是VTouch++(Hua等人,2026)——一个面向双臂操作任务的视觉增强触觉多模态数据集与基准框架。该工作在触觉视频预训练数据集的基础上,进一步提出了结合触觉流与视觉流的跨模态对齐策略,并设计了专门用于触觉视频自监督学习的预训练网络架构。此外,受该数据集中统一传感器布局的启发,后续研究如Tactile-BERT与VisuoTactile Transformer开始探索将触觉视频序列作为类语言输入,通过掩码视频建模与对比学习来学习更加鲁棒的触觉时空表征。这些衍生工作不仅验证了该数据集在推动触觉感知基础模型研究中的核心价值,也催化了更广泛范围内触觉-视觉融合操作的学术探索与工程实践。
数据集最近研究
最新研究方向
该数据集聚焦于非商业用途的触觉视频预训练,汇集了基于GelSight技术的多源触觉视频数据,涵盖双臂轮式人形机器人和手持灵巧终端等平台的复杂操纵任务。当前研究前沿方向包括跨平台的触觉表征自监督学习、多模态融合的机械臂操作技能迁移,以及面向家庭服务与工业场景的灵巧抓取与装配任务。该数据集通过标准化四触觉传感器、三相机及深度信息的时间同步架构,为构建通用触觉基础模型提供了高保真基准。其非商业许可协议促进了学术界在触觉推理、机器人模仿学习等热点领域的开放协作,对推动具身智能体从单一任务泛化到复杂自适应行为具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务