遇见数据集

ethanCSL/svla_koch_pick_n_place_vla_steering_height_experiment_setup

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- license: apache-2.0 task_categories: - robotics tags: - LeRobot configs: - config_name: default data_files: data/*/*.parquet --- This dataset was created using [LeRobot](https://github.com/huggingface/lerobot). ## Dataset Description - **Homepage:** [More Information Needed] - **Paper:** [More Information Needed] - **License:** apache-2.0 ## Dataset Structure [meta/info.json](meta/info.json): ```json { "codebase_version": "v3.0", "robot_type": "koch_follower", "total_episodes": 30, "total_frames": 8105, "total_tasks": 1, "chunks_size": 1000, "data_files_size_in_mb": 100, "video_files_size_in_mb": 200, "fps": 30, "splits": { "train": "0:30" }, "data_path": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet", "video_path": "videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4", "features": { "action": { "dtype": "float32", "names": [ "shoulder_pan.pos", "shoulder_lift.pos", "elbow_flex.pos", "wrist_flex.pos", "wrist_roll.pos", "gripper.pos" ], "shape": [ 6 ] }, "observation.state": { "dtype": "float32", "names": [ "shoulder_pan.pos", "shoulder_lift.pos", "elbow_flex.pos", "wrist_flex.pos", "wrist_roll.pos", "gripper.pos" ], "shape": [ 6 ] }, "observation.images.front": { "dtype": "video", "shape": [ 480, 640, 3 ], "names": [ "height", "width", "channels" ], "info": { "video.height": 480, "video.width": 640, "video.codec": "av1", "video.pix_fmt": "yuv420p", "video.is_depth_map": false, "video.fps": 30, "video.channels": 3, "has_audio": false } }, "observation.images.wrist": { "dtype": "video", "shape": [ 480, 640, 3 ], "names": [ "height", "width", "channels" ], "info": { "video.height": 480, "video.width": 640, "video.codec": "av1", "video.pix_fmt": "yuv420p", "video.is_depth_map": false, "video.fps": 30, "video.channels": 3, "has_audio": false } }, "observation.images.side": { "dtype": "video", "shape": [ 480, 640, 3 ], "names": [ "height", "width", "channels" ], "info": { "video.height": 480, "video.width": 640, "video.codec": "av1", "video.pix_fmt": "yuv420p", "video.is_depth_map": false, "video.fps": 30, "video.channels": 3, "has_audio": false } }, "timestamp": { "dtype": "float32", "shape": [ 1 ], "names": null }, "frame_index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "episode_index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "task_index": { "dtype": "int64", "shape": [ 1 ], "names": null } } } ``` ## Citation **BibTeX:** ```bibtex [More Information Needed] ```

This dataset was created using LeRobot and focuses on robotics, specifically for the koch_follower robot type. It contains 30 episodes with a total of 8105 frames at a frame rate of 30fps. The data is stored in parquet format, with a total data size of 100MB and video files size of 200MB. The dataset features include: action data (6 joint positions: shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, gripper position), observation state (same 6 joint positions as action), and image observations from three perspectives (front, wrist, side), each with a resolution of 480x640 pixels, 3 channels, and video codec av1. Additionally, it includes metadata such as timestamp, frame index, episode index, index, and task index. The dataset only has a training split (episodes 0 to 30) and is suitable for robot control and learning tasks.

提供机构:
ethanCSL
搜集汇总
数据集介绍
ethanCSL/svla_koch_pick_n_place_vla_steering_height_experiment_setup 数据集图片
构建方式
在机器人操作学习领域,高质量示范数据的采集对于训练视觉-语言-动作模型至关重要。该数据集依托LeRobot框架构建,采用koch_follower机械臂执行拾取与放置任务,通过遥操作方式采集了30个完整回合的示范轨迹,累计包含8105帧同步记录。采集过程中以30帧每秒的频率捕获动作向量与机器人状态,涵盖肩部旋转、肩部升降、肘部弯曲、腕部弯曲、腕部旋转及夹爪位置六个自由度,并同步录制前视、腕部及侧视三路视频流,所有数据以分块Parquet格式存储,保证了时序对齐与模态完整性。
使用方法
在具体使用层面,该数据集遵循LeRobot标准数据加载规范,用户可通过HuggingFace数据集库直接加载Parquet格式文件,并利用元信息中的路径模板定位各分块数据与对应视频文件。数据按训练集划分,包含全部30个回合,模型训练时可从observation.images.front、observation.images.wrist及observation.images.side三个字段读取视频帧,结合observation.state与action字段构建监督学习目标。由于视频采用av1编码且分辨率统一为480×640,建议在加载时配置相应解码器,并依据fps参数进行时序采样,以适配不同策略网络对输入频率的要求。
背景与挑战
背景概述
视觉-语言-动作(VLA)模型旨在将感知、语言理解与机器人控制融为一体,是具身智能领域的关键范式。该数据集依托LeRobot框架构建,采用koch_follower机械臂,涵盖30个回合、8105帧、30fps的抓取与放置操作演示,并同步采集前视、腕部与侧视三路视觉观测及六维关节状态与动作序列。其核心研究问题在于考察操作高度变化对VLA策略泛化性能的影响,为机器人模仿学习与泛化控制研究提供细粒度实验基准,对推动数据驱动的具身操作策略评估具有参考价值。
当前挑战
该数据集所面对的领域问题在于,机器人抓取与放置任务需在视觉遮挡、物体位姿多变与高度差异显著的条件下保持策略稳定,而现有VLA模型对垂直方向分布偏移尤为敏感,跨高度泛化能力不足。构建过程中的挑战体现在:真实机械臂演示需保证动作平滑与时间对齐,多视角视频与关节状态在30fps下的同步精度要求严苛;单任务30回合的样本规模有限,难以充分覆盖高度变化的连续谱;LeRobot格式对数据分块、编码与元信息一致性提出高标准,视频压缩亦需在存储效率与视觉保真度之间取得平衡。
常用场景
经典使用场景
在机器人学习与视觉-语言-动作(VLA)模型研究的浪潮中,该数据集立足于Koch机械臂平台,提供了30条高质量演示轨迹,涵盖抓取与放置任务,总帧数达8105帧。其经典使用场景聚焦于训练端到端的模仿学习策略,尤其是视觉-语言-动作模型的监督微调。研究者常利用其多视角视觉观测——包括前视、腕部与侧视摄像头——以及六自由度关节位置与夹爪状态,构建从视觉输入到动作序列的映射,从而探究机械臂在复杂空间中的泛化能力与操作精度。
解决学术问题
在学术研究层面,该数据集直面机器人操作中动作空间高维连续、视觉感知与运动控制耦合紧密等核心难题。它为验证模仿学习算法在真实物理系统上的有效性提供了标准化基准,有助于缓解仿真到现实迁移的鸿沟。同时,其多视角同步观测与精确的关节状态记录,使研究者能够系统分析视觉表征质量对策略性能的影响,进而推动数据高效学习、多模态融合等方向的理论进展,为VLA模型的鲁棒性与可解释性研究奠定实验基础。
实际应用
在实际应用场景中,该数据集赋能轻量级协作机械臂的快速任务部署。基于Koch平台的低成本特性与LeRobot框架的兼容性,开发者可借助该数据训练抓取与放置策略,并将其迁移至仓储分拣、实验室自动化、教育机器人等场景。多视角视觉信息与动作标签的紧密结合,使得策略在非结构化环境中具备一定的适应能力,为中小规模机器人应用提供了一条从数据采集到模型落地的可行路径。
数据集最近研究
最新研究方向
在机器人学习与视觉-语言-动作(VLA)模型交叉领域,该数据集聚焦于通过视觉引导实现精细操作任务,特别是抓取与放置场景中末端执行器高度调控的鲁棒性研究。当前前沿探索倾向于利用多视角视觉观测(前视、腕部、侧视)融合策略,以增强策略对空间高度变化的泛化能力,并借助LeRobot标准化框架推动可复现的基准测试。近期热点涉及将VLA模型与低层控制信号(如关节位置)解耦,以提升在非结构化环境中的适应性。该数据集为高度敏感操作任务提供了细粒度动作轨迹与同步视频流,对研究视觉-动作映射的时序一致性和高度调节机制具有重要支撑意义,进而推动通用机器人操作策略的实用化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务