trex_dataset
收藏资源简介:
T-Rex数据集是一个大规模、触觉反应的双手操作数据集,通过遥操作在Dexmate Vega-1机器人上使用两个Sharpa Wave灵巧手收集。存储为LeRobotDataset v3.0格式。该数据集包含多种模态数据,如RGB摄像头、原始触觉和变形触觉视频、指尖六维力传感器以及关节状态/目标,涵盖了5,464个片段和约547万帧(约50小时,30帧/秒),涉及5,370条语言注释轨迹、22个运动基元和207个对象。
The T-Rex dataset is a large-scale, tactile-reactive bimanual manipulation dataset collected via teleoperation on a Dexmate Vega-1 robot using two Sharpa Wave dexterous hands. It is stored in the LeRobotDataset v3.0 format. The dataset includes multiple modalities such as RGB cameras, raw and deformed tactile videos, fingertip six-axis force sensors, and joint states/targets, covering 5,464 episodes and approximately 5.47 million frames (about 50 hours at 30 fps), involving 5,370 language-annotated trajectories, 22 motion primitives, and 207 objects.
数据集概述
T-Rex Dataset 是一个大规模、触觉反应性双臂操作数据集,通过远程操作在配备两只 Sharpa Wave 灵巧手的 Dexmate Vega-1 机器人上采集,以 LeRobotDataset v3.0 格式存储。
关键统计信息
| 属性 | 数值 |
|---|---|
| 机器人 | Dexmate Vega-1 双臂(每臂7个驱动关节)+ 2× Sharpa Wave 灵巧手(每只手5个指尖触觉传感器) |
| 模态 | 3个RGB摄像头 · 10个原始触觉 + 10个变形触觉视频 · 6轴指尖扳手 · 关节状态/目标 |
| 片段数 | 5,464 |
| 帧数 | 5,473,459(约50小时 @ 30 fps) |
| 任务 | 5,370条语言标注轨迹 · 22种运动基元 · 207个物体 |
| 格式 | LeRobotDataset v3.0(codebase_version: v3.0) |
数据采集设置
- 机器人: Dexmate Vega-1 双移动机器人,配备两只 Sharpa Wave 灵巧手;采集时轮子、躯干和头部关节固定,仅14个臂关节和两只手可驱动。
- 摄像头: 一个头戴式 ZED X Mini 立体摄像头(记录其左单目 RGB 流)和两个安装在手腕上的宽视角 ZED X One S 单目 RGB 摄像头,头戴摄像头覆盖整个可工作空间,手腕摄像头使手指可见且无明显手掌遮挡,所有视频流以 640×360 分辨率记录。
- 触觉: 每只手携带五个指尖触觉传感器,每个传感器存储原始传感器图像和估计的变形图(均为视频),以及估计的六轴净扳手(
observation.tactile_force)。 - 远程操作: Manus 手套捕捉指尖位置,通过微分逆运动学重映射至 Sharpa Wave 手;两个 VIVE 追踪器提供 SE(3) 手腕姿态,转换为臂关节指令(通过 Pink 库的微分逆运动学),经低通滤波后由制造商的低级级联 PID 控制器追踪;30 Hz 的高层级线程记录观测和关节空间目标,异步更新 300 Hz 的低级控制线程。
每帧特征
| 特征 | 形状 | 描述 |
|---|---|---|
observation.state |
(58,) | 关节位置,布局为 `[L_arm 7 |
action |
(58,) | 目标关节位置(相同布局) |
observation.tactile_force |
(60,) | 每个指尖的六轴扳手:(左, 右) × (拇指…小指) × (Fx, Fy, Fz, Mx, My, Mz) |
observation.images.{head_left, left_wrist, right_wrist} |
360×640×3 | 场景 + 手腕 RGB 摄像头 |
observation.images.tactile_{left,right}_raw_{finger} |
240×320(灰度) | 原始触觉传感器图像(10个 = 2只手 × 5根手指) |
observation.images.tactile_{left,right}_deform_{finger} |
240×240(灰度) | 触觉变形场(10个) |
手指顺序为 thumb, index, middle, ring, pinky。完整每维度关节名称见 meta/info.json(features[*].names)。
每片段元数据
meta/episodes/*.parquet 包含语言和任务标签(除标准 LeRobot 字段外):
| 字段 | 描述 |
|---|---|
caption |
人工验证的自然语言指令(5,370条唯一) |
motor_primitive |
22种运动基元之一(如 reach、lift_and_place) |
object |
标准物体名称(207个唯一) |
target |
标准目标/容器(仅对 lift_and_place 设置,其他为 null) |
触觉视频编码说明
- 原始和变形触觉视频以无损方式存储(
libx264 -qp 0),因为像素值具有物理意义。 - 它们为灰度图像,信号完全存在于亮度(Y)平面,使用全范围
yuvj420p,值在0-255之间。解码时使用frame.to_ndarray(format="gray")可精确恢复原始uint8图像。 - 无损 H.264 使用 High 4:4:4 Predictive 配置文件,大多数浏览器和 Hugging Face 预览无法解码,因此触觉视频在数据集页面上不显示缩略图。RGB 摄像头使用标准
yuv420p(有限范围,BT.709)并可正常预览。
数据集结构(布局)
data/chunk-000/file-.parquet 每帧状态/动作/触觉力(+索引列) videos/<key>/chunk-/file-.mp4 23个视频流(3个 RGB + 20个触觉) episodes_preview.parquet 为网页查看器整理的每片段标签 meta/info.json 特征、形状、fps、codebase_version meta/episodes/.parquet 每片段元数据+统计+视频指针 meta/tasks.parquet 任务(描述)表 meta/stats.json 全局特征统计
下载与使用
- 使用 LeRobot 加载:
LeRobotDataset("zekaiwang/trex_dataset") - 流式加载单个片段(无需完整下载): 可使用 T-Rex Quick Start 仓库中的工具或 Colab Notebook
- 数据集查看器: Hugging Face 表格查看器提供两种视图:
frames(默认,每帧状态/动作/触觉力)和episodes(每片段一行,含语言描述、运动基元、物体和目标)
相关资源
- 项目页面: https://tactile-rex.github.io/
- 论文: https://arxiv.org/abs/2606.17055
- 代码仓库: https://github.com/ZhuoyangLiu2005/T-Rex
许可信息
基于 MIT License 发布,© 2026 The Regents of the University of California。



