遇见数据集

test_tube_0729

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

该数据集使用LeRobot框架创建,专注于机器人操作任务。数据集包含由双机械臂系统(具体型号为bi_flexiv_rizon4_rt)采集的115个演示轨迹(episodes),共计705,709帧,所有数据均来自单一任务。数据以30fps帧率记录,包含20维的动作指令(action)和观测状态(observation.state),分别对应左右机械臂的工具中心点(TCP)位置(x, y, z)和姿态(r1-r6),以及左右夹爪的位置(gripper.pos)。此外,观测数据还包括多视角视觉信息:头相机、左右手腕相机以及左右触觉传感器各两个(共7个视频流),所有视频均为彩色(3通道),其中头相机和手腕相机分辨率为480×640,触觉传感器分辨率为400×700,均采用h264编码。数据集还包含时间戳、帧索引、episode索引、全局索引和任务索引等辅助字段。数据以Parquet文件(分块存储)和MP4视频文件形式组织,总数据文件大小约100MB,视频文件大小约200MB。该数据集适用于机器人模仿学习、行为克隆、强化学习等任务,特别适用于双机械臂精细操作场景。许可证为Apache-2.0。

This dataset is created using the LeRobot framework, focusing on robot manipulation tasks. It contains 115 demonstration episodes collected by a dual-arm robotic system (specifically the bi_flexiv_rizon4_rt), totaling 705,709 frames, all from a single task. Data is recorded at 30fps, including 20-dimensional action commands and observation states, corresponding to the tool center point (TCP) positions (x, y, z) and orientations (r1-r6) of the left and right arms, as well as the left and right gripper positions. Additionally, observations include multi-view visual information: a head camera, left and right wrist cameras, and two tactile sensors (left and right), totaling 7 video streams. All videos are color (3 channels), with head and wrist camera resolutions of 480×640, tactile sensor resolutions of 400×700, encoded using h264. The dataset also includes auxiliary fields such as timestamps, frame indices, episode indices, global indices, and task indices. Data is organized as Parquet files (chunked storage) and MP4 video files, with total data file size approximately 100MB and video file size approximately 200MB. This dataset is suitable for robot imitation learning, behavior cloning, reinforcement learning, and particularly for fine manipulation tasks with dual arms. License: Apache-2.0.

创建时间:
2026-07-31
原始信息汇总

数据集概述:Xense/test_tube_0729

基本信息

  • 许可证:Apache 2.0
  • 任务类型:机器人学(Robotics)
  • 创建工具:LeRobot(Hugging Face 的机器人学习框架)
  • 机器人类型:bi_flexiv_rizon4_rt(双臂 Flexiv Rizon 4 机器人)

数据集规模

指标 数值
总片段数(Episodes) 130
总帧数(Frames) 817,681
任务总数 1
块大小(Chunk Size) 1000
数据文件大小 100 MB
视频文件大小 200 MB
帧率(FPS) 30
训练/测试划分 Train: 0-130(全部用于训练)

数据特征

动作与状态(Action & Observation State)

  • 数据类型:float32
  • 维度:20 维
  • 包含内容
    • 左/右机械臂 TCP 位姿(x, y, z, r1-r6)
    • 左/右夹爪位置(gripper position)

视觉观测(Images)

相机视角 分辨率 编码 帧率
头部相机 480×640×3 H.264 30 FPS
左手腕相机 480×640×3 H.264 30 FPS
右手腕相机 480×640×3 H.264 30 FPS
左触觉传感器 0 400×700×3 H.264 30 FPS
左触觉传感器 1 400×700×3 H.264 30 FPS
右触觉传感器 0 400×700×3 H.264 30 FPS
右触觉传感器 1 400×700×3 H.264 30 FPS

附加元数据

  • timestamp:时间戳(float32)
  • frame_index:帧索引(int64)
  • episode_index:片段索引(int64)
  • index:索引(int64)
  • task_index:任务索引(int64)

数据格式

  • 数据文件:Parquet 格式,路径为 data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件:MP4 格式,路径为 videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

引用信息

该数据集基于 LeRobot-Xense 项目创建(GitHub: https://github.com/Vertax42/lerobot-xense),支持 Xense 触觉机器人。引用格式见数据集的 BibTeX 条目。

搜集汇总
数据集介绍
test_tube_0729 数据集图片
构建方式
在机器人学习领域,高质量示范数据的采集与标准化封装是推动算法泛化的重要基石。该数据集依托LeRobot框架构建,基于bi_flexiv_rizon4_rt双臂机器人平台,对同一任务执行了200次示教,累计采集1,276,475帧、30fps的多模态时序数据。原始数据以100MB为分片粒度,按chunk-file的目录结构序列化存储为Parquet文件,视频流则独立编码为H.264格式,形成元数据与视觉数据解耦的混合存储方案,以提升大规模数据的读取效率。
特点
该数据集的核心特征在于其多模态感知融合与时序一致性。动作与状态向量维度均为20,涵盖左右机械臂末端位姿及夹爪开度,构成统一的双臂协同控制空间。视觉方面,除头部及左右腕部相机外,还集成了左右各两路触觉图像传感器,为模型提供接触力分布的视觉化表征,这在精细操作任务中尤为关键。所有视频流统一采用yuv420p像素格式,分辨率按头部与腕部(480×640)及触觉传感器(400×700)区分,确保时空对齐的可靠性。
使用方法
使用该数据集时,研究者可依托LeRobot提供的可视化工具,通过指定数据集路径在线浏览各轨迹的时序演化与多视角图像,快速校验任务执行质量。加载阶段,可依据data_path与video_path模板结合chunk_index与file_index索引,按需读取Parquet记录与对应视频帧。数据划分采用0:200的全量训练集切分,适用于模仿学习、多模态策略训练及触觉辅助的机器人操作研究。模型训练时需注意同步解析动作标签与多路视觉观测,并可按fps参数对齐时间步长。
背景与挑战
背景概述
在具身智能与机器人学习迅猛演进的浪潮中,高质量的真实世界操作数据成为驱动策略泛化的核心要素。test_tube_0729数据集由Xense Robotics Team与vertax42等研究人员依托LeRobot框架构建,收录200条操作轨迹、逾127万帧,同步采集头部、双腕及四路触觉图像与20维双臂笛卡尔位姿和夹爪状态,聚焦触觉感知与精细操作任务。该数据集以多模态高频率(30fps)的触觉-视觉-动作同步为特色,为触觉驱动的机器人操作策略学习提供了稀缺的真实世界基准,对柔体与精密操作研究具有重要推动作用。
当前挑战
该数据集所应对的核心挑战在于触觉信号与视觉信息在时空维度上的高精度对齐与融合,以及双臂协调操作中接触状态的高频动态建模。构建过程中面临触觉传感器标定与漂移补偿、多相机与触觉阵列同步采集的时序一致性、以及精细操作任务中动作空间复杂度的显著提升。此外,触觉图像与视觉图像在分辨率、帧率和编码格式上的异构性,要求数据管道具备稳健的多模态序列化能力,以支撑下游策略学习对时序连贯性与物理接触表征的严苛需求。
常用场景
经典使用场景
在双臂精细操作与触觉感知研究领域,test_tube_0729数据集构成了面向试管操控任务的典型示范。该数据集依托bi_flexiv_rizon4_rt双臂机器人平台,以30帧每秒的速率同步采集头部、左右腕部及四路触觉传感器的多模态观测流,并记录末端执行器位姿与夹爪位置构成的20维动作向量,共涵盖200个回合、逾127万帧的连续操作轨迹。研究者通常将其用于模仿学习与视觉-触觉联合表征的算法验证,尤其适合评估策略在接触丰富任务中的鲁棒性。
衍生相关工作
该数据集以LeRobot框架为基座,催生了LeRobot-Xense这一触觉机器人支持扩展,将触觉传感模态系统性地纳入开源机器人学习生态。围绕该数据展开的研究多聚焦于视觉-触觉融合策略网络设计、触觉表征的自监督预训练以及接触感知的模仿学习目标函数改进。此类工作推动了触觉数据集格式标准化与跨平台策略迁移的研究进程,为后续多任务触觉操作数据集的构建提供了可借鉴的范式与工具链支持。
数据集最近研究
最新研究方向
在具身智能与灵巧操作的交汇处,test_tube_0729数据集凭借双Flexiv Rizon4机械臂、高频视觉与四路触觉感知的融合架构,正推动触觉-视觉-动作联合表征学习成为机器人学习社区的前沿焦点。其200条示教轨迹与逾百万帧同步记录,为接触密集型任务中的多模态策略泛化提供了稀缺资源。近期研究趋势倾向于利用此类带有丰富触觉反馈的数据,探索扩散策略与视觉-触觉预训练模型在精密装配及试管操作中的迁移能力,进而提升机器人在非结构化环境下的鲁棒性与操作灵巧度。LeRobot生态的兼容性亦加速了该数据集在开源社区中的复现与基准测试,为触觉机器人学习树立了新的实证标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务