gelsight-mini-pretrain
收藏资源简介:
GelSight Mini Pretrain是一个统一的、包含约865,000个原始GelSight Mini触觉RGB帧的数据集,专门用于自监督表示学习。该数据集聚合了八个公开可用的GelSight Mini触觉传感器数据集,包括FoTA、py3DCal、FEATS、GelSLAM、TactileTracking、Real Tactile MNIST和FeelAnyForce,将它们整合到一个统一的模式中。所有图像均以JPEG格式(质量92)重新编码,并存储在Parquet文件中,便于流式传输。数据集的一个关键特征是明确区分了带标记点(‘markered’)和无标记点(‘markerless’)的凝胶变体,这对于避免自监督学习目标混淆至关重要。数据集包含多个配置(子集),每个子集对应一个源数据集,并具有不同的标签类型,例如6DoF末端执行器姿态、接触力、压头形状、数字类别等。总数据量约为24 GB,适用于图像分类、特征提取、图像到图像等任务,是机器人触觉感知、预训练和自监督学习研究的宝贵资源。
GelSight Mini Pretrain is a unified dataset containing approximately 865,000 raw GelSight Mini tactile RGB frames, specifically designed for self-supervised representation learning. It aggregates eight publicly available GelSight Mini tactile sensor datasets, including FoTA, py3DCal, FEATS, GelSLAM, TactileTracking, Real Tactile MNIST, and FeelAnyForce, integrating them into a unified schema. All images are re-encoded in JPEG format (quality 92) and stored in Parquet files for efficient streaming. A key feature of the dataset is the explicit distinction between markered and markerless gel variants, which is crucial to avoid confusion in self-supervised learning objectives. The dataset includes multiple configurations (subsets), each corresponding to a source dataset with different label types, such as 6DoF end-effector poses, contact forces, indenter shapes, digit categories, etc. The total data volume is approximately 24 GB, making it suitable for tasks like image classification, feature extraction, and image-to-image translation, serving as a valuable resource for research in robotic tactile perception, pre-training, and self-supervised learning.
好的,根据您提供的信息,以下是对该数据集的总结:
GelSight Mini Pretrain 数据集详情
数据集概述
- 数据集名称: GelSight Mini Pretrain
- 数据集规模: 约 865,000 张原始触觉RGB图像帧,文件大小约 24 GB。
- 许可证: cc-by-4.0
- 主要用途: 用于自监督表示学习的统一触觉数据集。适用于图像分类、特征提取、图像到图像等任务。
- 数据来源: 整合了 8 个公开的 GelSight Mini 触觉传感器数据集,统一为 Parquet 格式。
- 核心特色: 提供了清晰的 markered (标记点) 与 markerless (无标记点) 凝胶变体区分,避免模型混淆。
数据集构成
数据集根据来源(8个子集)进行分割,每个子集作为Hugging Face上的一个独立配置(config)。主要构成如下:
| 子集名称 | 来源数据集 | 帧数 | 凝胶类型 | 可用标签 |
|---|---|---|---|---|
fota_labeled |
FoTA | 29,494 | 混合 (66% 无标记, 34% 有标记) | 末端执行器 x,y,z + 四元数 |
fota_unlabeled |
FoTA | 516,523 | 混合 | 仅物体名称 |
threedcal |
py3DCal | 36,270 | 无标记 | 探针 x, y, 穿刺深度 (mm) |
feats |
FEATS | 16,711 | 有标记 | 压痕形状/尺寸 + 接触力 |
gelslam |
GelSLAM | 60,982 | 无标记 | 场景 + 物体名称 |
tactile_tracking |
TactileTracking (NormalFlow) | 1,143 | 无标记 | 物体 + 试验ID |
real_tactile_mnist |
Real Tactile MNIST | 153,600 | 无标记 | 数字类别 (0-9) + 轮次ID |
feelanyforce |
FeelAnyForce | 50,997 | 无标记 | 物体名称 |
帧数总计: 865,720 帧。
数据特点与处理流程
- 格式统一: 所有图像统一为 JPEG 质量 92 的字节串,存储在 Parquet 文件中。
- 模式统一: 保留 GelSight Mini 的两种原生分辨率 (640×480 RGB 和 320×240),可通过
height和width列过滤。 - 标记点检测: 对 FoTA 数据集进行了自动标记点检测,修复了其“混合凝胶”的问题,在数据集中新增了
markered列用于区分。 - 空帧清除: 移除了 FEATS 数据集中约 5,302 张无接触的空帧(|f_z| < 0.5 N)。
- 自适应二次采样: 对后续新增的四个数据集(GelSLAM等)进行了自适应采样,将每个来源的帧数上限设为 200K。
- 有效性过滤: 对视频来源的数据集去除了接触前/后的无效运动帧。
- 感知哈希去重: 在每个捕获序列内去除视觉上几乎相同的相邻帧。
- 分裂: 每个上游数据集都有自己独立的 Hugging Face 配置,便于用户组合训练。
统一数据模式 (Schema)
无论数据来源如何,每一行数据都包含相同的列,不适用时字段为 null。
| 列名 | 类型 | 描述 |
|---|---|---|
image |
图像 (二进制) | 触觉RGB帧,JPEG字节,自动解码为PIL图像 |
(此外还包括一系列可选元数据列,如姿态、力、物体名称等,基于来源数据集提供。)
关键统计数据
feats 子集
- 力传感器覆盖: 包括6种压痕形状(长方体、球体、圆柱体、十字形、棱锥形和未标注),6个不同的测试分裂(包括分布外测试)。
- 法向力范围: f_z ∈ [−73.3, 0.0] N。
- 凝胶变体: 提供了一个
gel_variant列,区分“标准有标记凝胶”和“另一种物理凝胶”。
fota_labeled 子集
- 目标对象: 包含13种不同的接触物体。
- 姿态覆盖: 提供了丰富的末端执行器6自由度位姿标签。
real_tactile_mnist 子集
- 数字类别平衡: 每个数字0-9的触觉图像数量基本均衡。




