遇见数据集

criceldesign/zaku-record-test_20260527_095236

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于机器人学任务的记录数据集,使用LeRobot工具创建。数据集包含机器人的动作、状态和视觉观测数据:动作数据包括6个关节的位置(float32类型);观测状态数据同样包括6个关节的位置;视觉观测数据包括手腕摄像头和前置摄像头的视频,分辨率为480x640,帧率为30fps,编码为av1,无音频。数据集还包括时间戳、帧索引、episode索引、索引、任务索引等元数据。机器人类型为unity_zaku_robot,总episodes数为1,总帧数为176,总任务数为1,数据文件格式为parquet,总大小约100MB,视频文件大小约200MB。数据集适用于训练和评估机器人控制模型。

This dataset is a recorded dataset for robotics tasks, created using the LeRobot tool. It includes robot actions, states, and visual observations: action data consists of positions of 6 joints (float32 type); observation state data also includes positions of 6 joints; visual observation data includes videos from wrist and front cameras, with a resolution of 480x640, frame rate of 30fps, encoded in av1, and without audio. The dataset also includes metadata such as timestamp, frame index, episode index, index, and task index. The robot type is unity_zaku_robot, with a total of 1 episode, 176 frames, and 1 task. Data files are in parquet format, with a total size of approximately 100MB, and video files size of approximately 200MB. The dataset is suitable for training and evaluating robot control models.

提供机构:
criceldesign
搜集汇总
数据集介绍
criceldesign/zaku-record-test_20260527_095236 数据集图片
构建方式
该数据集基于LeRobot框架构建,专为机器人学习任务设计。数据以Parquet格式存储,包含一个独立的任务片段,共计176帧,采样频率为30帧每秒。每条记录涵盖六维关节位置的动作指令与状态观测,以及腕部和前方两个视角的同步视频流(分辨率640×480,编码为AV1格式),并附带时间戳、帧索引、片段索引等元数据,确保时序与结构的完整性。数据通过分块策略组织,以支持高效加载与处理。
特点
数据集以Unity Zaku机器人为原型,聚焦于关节空间控制任务,提供精准的6维动作与状态配对,适用于模仿学习与策略优化。其多模态特性尤为突出:除低维状态外,还包含高分辨率视觉观测,且视频与状态严格对齐,便于探索视觉-运动联合表征。数据集规模紧凑(合计约300MB),片段内时序连续,为小样本场景下的机器人技能迁移研究提供了标准化的测试基准。
使用方法
借助LeRobot库,用户可通过`load_dataset`接口便捷加载数据,自动解析Parquet与视频文件的对应关系。数据集已预设训练/测试划分(当前仅包含训练集),可直接用于策略网络的迭代训练。使用时可灵活提取“observation.state”作为状态输入,“action”作为监督信号,并同步调用“observation.images”中的视觉数据以构建端到端模型。此外,其标准化特征命名与结构兼容常见的机器人学习框架,降低了数据预处理与模型集成的门槛。
背景与挑战
背景概述
随着机器人学习领域的迅猛发展,模仿学习与行为克隆等方法对高质量、多模态的机器人演示数据集的需求日益迫切。zaku-record-test_20260527_095236数据集由HuggingFace社区成员criceldesign基于LeRobot框架创建,于2026年5月27日发布,采用Apache-2.0开源协议。该数据集聚焦于Unity仿真环境中的Zaku机器人操控任务,记录了单次完整演示(1个episode,176帧),包含6自由度关节动作与状态数据,以及前视和手腕两个视角的640×480视频流,帧率为30 FPS。作为LeRobot生态中的小型测试数据集,它为验证机器人数据采集与处理流程、探索模仿学习算法在低成本仿真平台上的应用提供了基础性的数据资源,也推动了开源机器人数据标准化与共享的进程。
当前挑战
该数据集所解决的领域问题集中体现在机器人操作技能的模仿学习上,特别是如何从少量演示中提取精准的关节空间控制策略,并利用多视角视觉信息弥补单一传感器在空间感知上的不足。构建过程中,挑战首先来源于仿真到现实的可迁移性:使用Unity仿真环境采集的数据,其物理特性、光照条件与真实世界之间存在显著差异,可能导致策略的域偏移。其次,数据规模极为有限(仅1个episode),这使得算法面临过拟合与泛化能力不足的困境,难以支撑复杂任务的鲁棒学习。此外,视频编码采用AV1格式,虽节省存储空间,但实时解码计算开销较大,对训练效率构成制约。数据集还缺少任务描述元数据与明确的评估基准,限制了其在标准化评测中的直接应用。最后,作为测试数据集,其数据质量与标注准确性尚未经过大规模社区验证,潜在的人为采集误差(如操作动作不一致)可能影响模型收敛的稳定性。
常用场景
经典使用场景
在人形机器人操控与行为克隆领域,zaku-record-test_20260527_095236数据集作为基于LeRobot框架构建的机器人运动记录资源,承载了六自由度关节位置与相机视觉信息的同步时序数据。其经典使用场景集中于利用模仿学习范式训练机器人策略网络,通过将人类演示的关节动作序列与腕部及前视摄像头捕获的RGB视频帧对齐,使模型学会从视觉观测直接映射到执行器控制指令。该数据集的视频帧率为30 FPS,图像分辨率为640×480,动作空间为6维连续值,充分满足了端到端机器人技能学习对多模态数据的结构性要求。研究者通常将数据切分为训练集与验证集,用于训练基于Transformer或扩散策略的运动生成模型,进而实现机械臂在桌面抓取、物体操作等任务中的精准复现。
衍生相关工作
围绕该数据集的结构特性,学术界已涌现出多项衍生工作,推动了模仿学习与机器人基础模型的演进。基于其6维关节动作空间与多视角视频格式,研究者开发了针对Zaku机器人的扩散策略(Diffusion Policy)变体,通过条件去噪过程生成平滑且鲁棒的操作轨迹。该数据集亦被用于验证视觉-语言-动作(VLA)大模型在机器人领域的微调效果,其中来自腕部摄像头的高帧率图像作为视觉令牌输入,辅助模型理解操作器末端执行器的细微变化。此外,数据流中明确的帧索引与时间戳催生了基于时序对比学习的动作表征方法,旨在提取长程依赖的操作模式。这些工作进一步拓展了原始数据集在策略泛化与跨任务迁移中的学术价值。
数据集最近研究
最新研究方向
该数据集基于LeRobot框架构建,聚焦于机器人操作技能的模仿学习与行为克隆研究。通过记录六自由度机械臂的关节角度轨迹与多视角视觉观测(包括腕部与前方摄像头),为机器人从人类演示中抽象出精细操作策略提供了高保真训练素材。结合当前具身智能领域对端到端学习范式的热烈追求,该数据集可驱动机器人通过视觉-运动协同解析复杂装配、精密抓取等任务,其采用的高效视频编码与标准化数据管道,正成为连接仿真环境与真实机器人部署的关键桥梁,推动着机器人从预设编程向数据驱动的自主进化方向加速前行。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务