遇见数据集

salmonHan/record-test_20260527_235303

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人数据集,使用LeRobot工具创建,专为机器人学习和控制任务设计。数据集包含一个完整的episode,总计1797个帧,对应一个任务。数据以parquet文件格式存储,视频文件以mp4格式存储,帧率为30fps。数据集的特征包括动作(action)、观察状态(observation.state)、前摄像头图像(observation.images.front)、时间戳(timestamp)、帧索引(frame_index)、episode索引(episode_index)、索引(index)和任务索引(task_index)。动作和观察状态均涉及机器人的6个关节位置:肩部平移(shoulder_pan.pos)、肩部提升(shoulder_lift.pos)、肘部弯曲(elbow_flex.pos)、手腕弯曲(wrist_flex.pos)、手腕旋转(wrist_roll.pos)和夹爪位置(gripper.pos),数据类型为float32。前摄像头图像的分辨率为720x1280,3通道(RGB),采用av1编解码器,无音频。数据集适用于机器人控制、模仿学习或强化学习等研究,许可证为Apache-2.0。

This is a robotics dataset developed with the LeRobot toolkit, tailored for robotics learning and control tasks. The dataset contains one full episode, totaling 1797 frames corresponding to a single task. The data is stored in Parquet file format, while the video files are in MP4 format with a frame rate of 30 fps. The dataset includes the following features: action, observation.state, front camera image (observation.images.front), timestamp, frame_index, episode_index, index, and task_index. Both the action and observation.state encompass 6 joint positions of the robot: shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, and gripper.pos, with a data type of float32. The front camera images have a resolution of 720x1280, 3 RGB channels, utilize the AV1 codec, and contain no audio. This dataset is applicable to research in robotics control, imitation learning, reinforcement learning, and related fields. The license for this dataset is Apache-2.0.

提供机构:
salmonHan
搜集汇总
数据集介绍
salmonHan/record-test_20260527_235303 数据集图片
构建方式
该数据集依托于LeRobot框架构建,以Apache-2.0许可证开放。数据采集面向so_follower类型机器人,记录单次任务回放中的完整交互序列,涵盖共计1797帧、时长约60秒的连续运动数据。数据通过高帧率摄像头采集前置视角图像,分辨率达1280×720像素,并同步记录六自由度关节动作指令与状态量。原始数据以Parquet格式分块存储,每块容量限制为1000帧,同时以AV1编码的视频文件保存视觉信息,兼顾压缩效率与回放质量,整体数据规模约300MB。
特点
该数据集展现出高精度的时空对齐特性,所有帧均标注动作序列、关节状态与时间戳,支持端到端的机器人策略学习。其视觉模态采用彩色视频流,帧率为30FPS,与底层控制信号严格同步,提供了丰富的环境表征。数据集中动作与状态空间维度一致,均为六维连续值,涵盖肩、肘、腕及夹爪等关键关节,适合用于模仿学习或强化学习的基准测试。单次任务的设计聚焦于特定操作场景,便于验证算法在有限步骤内的泛化能力。
使用方法
推荐通过HuggingFace提供的可视化工具预览数据集内容,以快速评估数据质量。使用时,可借助LeRobot库直接加载Parquet与视频文件,自动解析为统一的轨迹数据结构。数据集已预设训练集划分,支持直接用于监督学习或离线策略优化。对于算法开发,用户需关注时间序列的连续性与帧索引关系,可基于'frame_index'与'episode_index'字段重组回放片段。值得注意的是,由于动作与状态空间同名,适合构建基于视觉观测的低层级控制器模型。
背景与挑战
背景概述
该数据集由salmonHan团队基于LeRobot框架创建,旨在为机器人操作学习提供高质量的示范数据。数据集记录了一个SO Follower机器人执行单任务操作的完整过程,包含1个演示片段、1797帧图像和对应的动作序列,总时长约60秒。其核心研究问题在于如何通过采集真实机器人操作数据,驱动模仿学习算法的发展,从而提升机器人对精细操作任务的泛化能力。作为LeRobot生态系统中的示范性数据集,它为验证从感知到动作的端到端学习框架提供了可复用的数据基础,对推动机器人学习领域的低成本数据共享与标准化研究具有参考价值。
当前挑战
该数据集所解决的领域挑战聚焦于机器人操作中的少样本模仿学习问题,即如何从有限的人类演示中提取可泛化的操作策略,以应对真实环境中的动态变化。在构建过程中,数据采集面临硬件同步与噪声控制的难题,需确保6自由度关节位置与视觉观测的精确对齐;同时,单次演示导致数据量不足,难以覆盖多任务、多场景的泛化需求,且视频编码格式(av1)与高分辨率(720p)对存储与计算资源提出了额外要求。这些挑战共同限制了数据集在复杂机器人操作任务中的鲁棒性与可扩展性。
常用场景
经典使用场景
record-test_20260527_235303数据集专为机器人模仿学习研究而构建,尤其聚焦于基于视觉与状态信息的机械臂操作任务。该数据集通过LeRobot框架采集,包含一个完整回合的机器人跟随任务,记录了6自由度机械臂的动作指令、关节状态及高清视觉图像(1280×720,30fps)。其经典使用场景在于训练端到端的策略网络,利用观测状态与摄像头图像联合预测动作序列,实现机器人从人类示教中复现精细操作。研究者可借助该数据集训练基于扩散策略或Transformer架构的模仿学习模型,探索多模态输入融合对操作精度与泛化能力的影响。简洁的单一任务设计和结构化数据格式(parquet + mp4),使其成为快速验证算法有效性和进行基线对比的理想基准。
实际应用
在实际应用中,该数据集为工业柔性自动化与协作机器人提供了极具价值的训练素材。基于它的模仿学习模型可被部署至装配、分拣、包装等场景中,使机器人通过少量人类演示快速习得新工序,免去繁琐的手工编程。其视觉模块支持实时识别工件位姿与操作环境变化,状态通道则精细调控机械臂各关节角度,确保动作的精准与平滑。在医疗辅助领域,该数据集还可用于训练远程操控或自主执行简单诊疗操作的机器人系统。此外,结合LeRobot框架,开发者能将其扩展为多任务数据集,支撑家庭服务、仓储物流等场景下的技能迁移与增量学习,显著降低部署智能机器人系统的门槛与迭代成本。
衍生相关工作
该数据集衍生了一系列具有影响力的研究成果。在模仿学习领域,研究者基于此格式的数据集开发了如ACT(Action Chunking with Transformers)和Diffusion Policy等前沿算法,巧妙利用时序建模与扩散生成技术提升操作动作的连贯性与鲁棒性。在表示学习方面,相关工作探索了从多视角图像与状态联合中提取通用特征,预训练可视化和状态表征,并微调至下游任务,显著减少了场景适配所需演示数量。此外,该数据集也推动了机器人基础模型研究,如在LeRobot基准上评估多任务统一策略的迁移能力,以及结合大语言模型进行任务指令理解与执行。这些工作共同推动了可从有限示教数据高效习得复杂操作技能的通用机器人智能体发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务