遇见数据集

Keith-Luo/sim_stow_zed_left_240x240_without_wrist_cam

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,专注于机器人技术领域。数据集包含100个episodes,总计50,000帧数据,帧率为25fps。特征包括观察状态(21维浮点数组)、动作(21维浮点数组)、来自左ZED摄像头的图像观察(3通道,240x240分辨率,视频格式)、环境状态(31维浮点数组)、完成标志(布尔值)、时间戳、帧索引、episode索引、索引和任务索引。数据以parquet文件格式存储,总数据文件大小为100MB,视频文件大小为200MB。数据集使用Apache 2.0许可证,并针对av-aloha机器人类型设计,包含训练分割(0:100)。

This dataset was created using LeRobot and is focused on robotics. It contains 100 episodes with a total of 50,000 frames at 25fps. Features include observation state (21-dimensional float32 array), action (21-dimensional float32 array), image observation from left ZED camera (3 channels, 240x240 resolution, video format), environment state (31-dimensional float32 array), done flag (bool), timestamp, frame index, episode index, index, and task index. Data is stored in parquet format, with total data file size of 100MB and video file size of 200MB. The dataset uses Apache 2.0 license, is designed for av-aloha robot type, and includes a train split (0:100).

提供机构:
Keith-Luo
搜集汇总
数据集介绍
Keith-Luo/sim_stow_zed_left_240x240_without_wrist_cam 数据集图片
构建方式
该数据集基于LeRobot框架构建,专注于机器人模仿学习领域。数据通过ZED双目相机左侧摄像头以240x240像素分辨率采集,未配备腕部相机。数据集包含100个完整任务片段的50000帧图像与状态记录,每个任务片段对应单一任务,以每秒25帧的采样频率捕捉机器人的操作过程。数据以Parquet格式存储结构化信息,采用AV1编码压缩视频文件,并按照训练集占比100%进行拆分,便于模型训练与验证。
特点
数据集最显著的特点在于其多模态融合特性,每一帧同时包含21维的机器人关节状态向量、31维的环境状态向量以及对应的21维动作指令,形成完整的观测-动作闭环。视觉信息以三通道RGB图像形式提供,经标准化处理为240x240像素尺寸。数据容量控制在300MB以内,其中视频文件占200MB,结构化数据占100MB,适合在资源受限的环境中进行快速迭代实验。
使用方法
推荐使用LeRobot库直接加载该数据集,通过调用`load_dataset('Keith-Luo/sim_stow_zed_left_240x240_without_wrist_cam')`即可获取标准化的训练数据接口。用户可通过HuggingFace提供的可视化工具在线预览数据集内容。在模型训练中,可将`observation.images.zed_cam_left`作为视觉输入,`observation.state`与`observation.environment_state`作为状态输入,配合`action`作为监督信号,构建端到端的模仿学习方案。数据的分块存储结构支持流式读取,适合大规模并行训练场景。
背景与挑战
背景概述
该数据集由Keith-Luo等人创建,基于LeRobot框架构建,专为机器人操作任务设计。其核心研究聚焦于模拟环境中的机械臂操控,通过ZED相机左眼采集240x240分辨率的视觉数据,并记录21维的状态与动作空间,旨在推动模仿学习与机器人自主决策的发展。数据集包含100个场景、总计50000帧的连续交互记录,以25帧每秒的频率捕获细腻的运动轨迹,为机器人迁移学习提供了基础资源。作为开源社区的重要贡献,该数据集遵循Apache-2.0许可,在机器人领域内促进了对高维状态与视觉融合算法的探索。
当前挑战
当前面临的核心挑战在于模拟环境与现实场景之间的域鸿沟,限制了在真实机器人上的泛化能力。由于缺乏腕部相机视角,模型需依赖单目视觉完成精细操作,对遮挡与光照变化鲁棒性不足。构建过程中,数据采集需同步21维动作与状态信息,确保视频与传感器时序对齐,同时协调AV-ALOHA机器人硬件与ZED相机的协同运作,克服了多模态数据流的高精度标注与格式归一化难题。
常用场景
经典使用场景
在机器人学习与模仿学习的前沿探索中,本数据集作为通过LeRobot框架采集的高保真模拟数据,其经典使用场景聚焦于双臂灵巧操作任务的深度研究。数据集包含100个完整回合、总计五万帧的精细记录,以25帧/秒的速率同步捕获双臂本体状态向量(21维)、环境状态向量(31维)及左眼光学视图(240x240分辨率),为构建端到端的行为克隆模型提供了完整的状态-动作对序列。研究者可借此训练模型从视觉与状态混合表征中直接映射21维动作空间,特别适用于模拟环境下的精密装配、物体传递等需要高精度协同控制的操作范式。
实际应用
在面向真实世界的场景转化中,该数据集的实用价值主要体现在赋能模拟到现实迁移技术栈的快速迭代。具体而言,其记录的21维动作数据与31维环境状态信息,可直接用于训练基于强化学习或最优控制理论的交互策略,进而部署于诸如Avalon等双臂机器人平台,执行精密零件装配、实验室器皿传递等高精度任务。此外,其低分辨率左眼视觉输入的设计也为轻量化感知系统的研发提供了训练基础,推动了移动操作机器人或受限空间内作业的实时策略推理能力。该数据集的Apache-2.0开源许可进一步降低了产学研团队将算法验证成果落地的门槛。
衍生相关工作
围绕该数据集已涌现出多项具有代表性的衍生研究工作,这些工作多聚焦于注意力机制驱动的策略学习与多模态表征对齐。例如,研究者基于其多模态结构发展了结合时序Transformer的分阶段模仿学习框架,验证了在有限示范数据下高效复现复杂操作序列的可行性;另有工作以此数据集为基准,提出了改进的双臂协同动作融合方法,通过解耦共享状态与私有视觉特征提升了策略泛化性。数据集的视频编码采用AV1压缩格式,也激发了在高效视频表征存储与低延迟回放方面的技术探索。这些工作共同勾勒出从数据构建、策略学习到任务泛化的完整研究路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务