遇见数据集

yxma/gelsight-mini-pretrain-video

收藏
Hugging Face2026-05-18 更新2026-05-31 收录
官方服务:

资源简介:

GelSight Mini Pretrain · Video / Sequence Subset 是一个专注于视频触觉预训练的数据集,作为主数据集(yxma/gelsight-mini-pretrain)的补充。与主数据集将每帧视为独立图像不同,该数据集保留了时间序列,每行代表一帧,按顺序排列,并包含明确的序列ID和位置元数据,适用于视频触觉预训练。数据集跳除了感知哈希去重,以保留连续帧之间的微小变化,这些变化正是需要学习的时间信号。它使用与主数据集相同的区域和强度有效性过滤器,丢弃静止帧,并添加了序列级元数据(如sequence_id、frame_in_seq、sequence_length、fps)。数据来源包括gelslam、tactile_tracking、fota_unlabeled和real_tactile_mnist等视频序列,推荐用于视频/时间触觉预训练、慢动作接触动力学建模、模拟到现实的迁移学习以及跨帧对比学习。数据集采用CC-BY-4.0许可证。

license: CC-BY-4.0 task_categories: - 图像分类 - 特征提取 - 视频分类 tags: - 触觉(tactile) - GelSight - GelSight Mini - 视频 - 序列 - 时序 - 触觉视频 - 预训练 size_categories: - 100K<n<1M pretty_name: GelSight Mini 预训练·视频 # GelSight Mini 预训练·视频/序列子集 > 🎬 **本数据集为 [`"yxma/gelsight-mini-pretrain"`](https://huggingface.co/datasets/yxma/gelsight-mini-pretrain) 的配套仓库。** > 原仓库将每个保留帧视为独立图像,而本仓库**保留时序序列**——每行对应一帧,按顺序排列,带有明确的序列ID+位置元数据,用于**视频触觉预训练**。 ## 本仓库创建初衷 原仓库的流水线在每次采集内应用**感知哈希去重(perceptual-hash dedupe)**,移除近乎相同的相邻帧。该方案对图像级预训练而言十分理想(无冗余),但**对视频级预训练存在缺陷**——帧间微小的变化正是我们需要学习的时序信号。 本仓库的优化点如下: - 采用与原仓库相同的区域+强度有效性过滤规则(移除静止接触凝胶的帧:`A ≥ 40, I ≥ 10, PIXEL_THRESH = 10`) - **跳过感知哈希去重步骤**,保留序列内的连续帧 - 添加**序列级元数据**,方便用户重建视频片段 ## 相较于原仓库的模式新增 | 列名 | 数据类型 | 描述 | |---|---|---| | `sequence_id` | 字符串 | 该帧所属序列的唯一标识符 | | `frame_in_seq` | int32 | 该帧在序列内的0索引位置 | | `sequence_length` | int32 | 该序列内有效接触帧的总数(便于进行窗口划分) | | `fps` | float32 | 原始采集帧率(GelSight Mini通常约为25) | 原模式的现有列(`image`、`capture`、`split`、`height`、`width`、`source`、`markered`、`domain`等)均被完整保留。 ## 仅视频数据源 | 数据源 | 序列单元 | 序列数量 | 有效帧数 | |---|---|---:|---:| | `gelslam` | 每集对应一个`gelsight.avi`文件(用于追踪与重建) | 155 | 待确定 | | `tactile_tracking` | 每次试次对应一个`gelsight.avi`文件 | 84 | 待确定 | | `fota_unlabeled` | 每次采集(物体×姿态×侧面) | 60 | 待确定 | | `real_tactile_mnist` | 每次触摸对应一个触摸窗口 | 153,600 | 待确定 | *注:具体数量将在各数据源处理完成后补充。* ## 推荐应用场景 - 视频/时序触觉预训练(X帧片段) - 慢动作接触动力学建模 - 跨时间的仿真到真实(sim-to-real)迁移学习 - 序列内与跨序列的跨帧对比学习 ## 示例窗口划分代码 python from datasets import load_dataset import numpy as np # 加载数据集,指定数据源为gelslam,训练集划分 ds = load_dataset("yxma/gelsight-mini-pretrain-video", "gelslam", split="train") # 按sequence_id分组,并按frame_in_seq排序 import pandas as pd # 移除image列,仅保留元数据并转换为Pandas DataFrame df = ds.remove_columns(["image"]).to_pandas() # 按sequence_id分组,统计每个序列的帧数量 seqs = df.groupby("sequence_id")["frame_in_seq"].count() # 提取以"0042"序列的第0帧开始的16帧片段 clip = ds.filter(lambda r: r["sequence_id"] == "0042" and r["frame_in_seq"] < 16) # 将片段转换为PIL.Image列表,长度为16 frames = [r["image"] for r in clip] ## 项目状态 - 模式已正式确立 - 数据源处理进行中;具体数量待确定 ## 许可协议 采用CC-BY-4.0许可(与原仓库一致)。请按照主仓库[`SOURCES.md`](https://huggingface.co/datasets/yxma/gelsight-mini-pretrain/blob/main/SOURCES.md)中的`SOURCES.md`文件引用上游数据源。

提供机构:
yxma
二维码
社区交流群
二维码
科研交流群
商业服务