遇见数据集

handover_cube_to_human

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

该数据集是一个用于机器人操作任务的模仿学习数据集,由 LeRobot 框架创建。数据集记录了机器人将立方体递给人类的过程。数据包含49个演示片段(episodes),共6685帧,涵盖8个不同任务。每个样本包含来自三个不同视角的摄像头图像(分辨率224x224,AV1编码视频)、机器人状态(7维:6个关节位置和夹爪状态)、动作指令(7维:平移增量、旋转增量和夹爪控制)、时间戳、帧索引、episode索引和任务索引。数据以Parquet文件和视频文件的形式存储,并已预划分为训练集。该数据集适用于机器人模仿学习、行为克隆、离线强化学习等任务。

This dataset is an imitation learning dataset for robot manipulation tasks, created using the LeRobot framework. It records the process of a robot handing a cube to a human. The dataset contains 49 demonstration episodes with a total of 6685 frames, covering 8 different tasks. Each sample includes camera images from three different viewpoints (resolution 224x224, AV1 encoded video), robot state (7-dimensional: 6 joint positions and gripper state), action commands (7-dimensional: translation deltas, rotation deltas, and gripper control), timestamps, frame indices, episode indices, and task indices. Data is stored as Parquet files and video files, and has been pre-split into training sets. The dataset is suitable for tasks such as robot imitation learning, behavior cloning, and offline reinforcement learning.

创建时间:
2026-08-06
原始信息汇总

数据集概述:handover_cube_to_human

基本信息

  • 数据集名称:handover_cube_to_human
  • 许可证:Apache-2.0
  • 任务类别:机器人学(robotics)
  • 创建工具:由 LeRobot(https://github.com/huggingface/lerobot)创建
  • 代码库版本:v3.0

数据集规模

  • 总片段数(Episodes):49
  • 总帧数(Frames):6,685
  • 总任务数(Tasks):8
  • 数据划分:训练集(train)包含全部49个片段("0:49")
  • 数据文件大小:约100 MB(parquet格式)
  • 视频文件大小:约200 MB(mp4格式)

数据特征(Features)

数据集中包含以下特征字段:

特征名 数据类型 形状 说明
observation.images.camera1 视频 224×224×3 摄像头1图像,AV1编码,20 FPS
observation.images.camera2 视频 224×224×3 摄像头2图像,AV1编码,20 FPS
observation.images.camera3 视频 224×224×3 摄像头3图像,AV1编码,20 FPS
observation.state float32 7 机器人状态,包含6个关节(joint_0 至 joint_5)和1个夹爪(gripper)
action float32 7 动作指令,包含6维位姿增量(dx, dy, dz, droll, dpitch, dyaw)和夹爪控制(gripper)
timestamp float32 1 时间戳
frame_index int64 1 帧索引
episode_index int64 1 片段索引
index int64 1 全局索引
task_index int64 1 任务索引

数据存储结构

  • 数据文件路径data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件路径videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 分块大小:每块1000个样本(chunks_size: 1000)

视频编码参数

  • 编码格式:AV1
  • 视频帧率:20 FPS
  • 像素格式:yuv420p
  • 视频分辨率:224×224
  • 颜色通道数:3
  • CRF值:30
  • 无音频轨道

可视化与使用

该数据集支持通过 Hugging Face 的 LeRobot 可视化工具进行查看(可视化地址:https://huggingface.co/spaces/lerobot/visualize_dataset?path=Hungdd88/handover_cube_to_human)。数据以 parquet 格式存储结构化数据,视频以 mp4 格式存储。

引用信息

当前数据集的引用信息(BibTeX)尚未提供(标注为"More Information Needed")。

搜集汇总
数据集介绍
handover_cube_to_human 数据集图片
构建方式
本数据集名为handover_cube_to_human,源自LeRobot框架,专为机器人操控任务设计。其构建过程依托于真实物理环境中的机器人操作,记录了机器人将立方体递交给人类的全过程。数据以parquet格式存储,包含49个完整操作片段,共计6685帧,覆盖8个不同任务场景。每个片段均配备高频率(20Hz)的采样数据,集成了三个视角的视觉图像(224x224分辨率,AV1编码)以及7维的关节状态与动作指令,确保了对机器人运动学与动力学特征的全面捕捉。
特点
该数据集的核心特色在于其多模态、高保真度的数据融合。每个时间步均同步提供三目摄像头图像、关节位置、末端执行器姿态及夹爪状态,为模仿学习与强化学习算法提供了丰富的状态-动作对。数据以20FPS的帧率采集,并采用高效的AV1视频压缩编码,在保证视觉信息完整性的同时优化了存储效率。此外,数据集结构严谨,包含时间戳、帧索引、任务索引等元数据,便于进行时间序列分析与任务分割,展现了高度的可扩展性与再利用率。
使用方法
使用该数据集时,研究人员可借助LeRobot内置的工具链进行加载与可视化。数据集已预设训练集划分(前49个片段),可直接用于训练机器人操控策略。通过标准化接口,用户可轻松提取图像流、关节状态与动作指令,并适配PyTorch、TensorFlow等主流深度学习框架。此外,数据集支持动态可视化功能,允许用户在HuggingFace空间中直观查看每个episode的运动轨迹与传感器读数,从而加速模型调试与效果验证。
背景与挑战
背景概述
手递物动作在人与机器人协作中占据核心地位,其研究对于发展自然、流畅的人机交互至关重要。该数据集由Hungdd88等人于近期创建,依托Hugging Face的LeRobot框架,专注于人-机器人手递物场景中的视觉与状态数据采集。数据集包含49个演示片段,总计6685帧,覆盖8种不同的递送任务,通过三个视角的摄像头以20帧每秒的频率记录224x224分辨率的图像,同时存储了机器人关节状态与末端执行器动作信息。其核心研究问题在于赋予机器人感知人类递物意图、规划协作运动并安全完成交接的能力。该数据集为模仿学习与强化学习算法提供了高保真的训练样本,在机器人学习领域具有促进人机协作研究、推动具身智能发展的潜力。
当前挑战
在领域层面,手递物任务要求机器人理解人类行为意图并实时做出反应,涉及动态环境感知、运动预测与物理交互控制,而视觉遮挡、手部姿态多样性及物体形状差异均构成显著挑战。在数据构建过程中,确保多相机视角的同步、图像与状态数据的对齐以及动作标签的精准标注需要精心设计;同时,数据集规模相对有限,总帧数仅6685,可能不足以覆盖复杂多样的真实场景,限制了模型的泛化能力。此外,数据采集环境的特定性(如固定相机位置、预设任务范围)可能引入偏差,如何通过数据增强或域随机化提升鲁棒性仍是亟待解决的问题。
常用场景
经典使用场景
该数据集专为机器人操作研究设计,聚焦于人机交互中物体递送的核心任务。其经典使用场景涵盖模仿学习与强化学习算法的训练与评估,通过多视角视觉输入(三台摄像机)与本体感觉状态(关节角度及夹爪状态)的融合,使智能体能够学习从感知到动作的映射。研究者可将其作为基准,验证视觉运动策略在动态交互环境下的泛化能力,尤其关注双手协调与安全递送动作的生成。
解决学术问题
该数据集有效填补了人机交互中‘手递物’行为建模的空白,解决了以往机器人难以自然、安全地向人类传递物体的学术难题。它提供了包含8个任务、49个演示片段的高质量轨迹数据,支持对抓取姿态、释放时机及避障策略的定量分析,从而推动了对交互式操作技能的深入理解。其公开可复现的特性亦促进了不同算法间的公平比较,为研究社区提供了标准化评估平台。
衍生相关工作
基于该数据集,衍生出一系列前沿研究方向,包括多模态感知融合的视觉语言模型、基于Transformer的扩散策略以及端到端的模仿学习框架。研究者已将其用于开发具有鲁棒性的抓取-释放控制器,并探索跨域迁移学习,以增强不同相机视角下的适应性。该数据集还促进了人机交互安全评估方法的发展,以及实时动作预测与反馈控制系统的构建,推动了LeRobot生态系列工作的扩展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务