遇见数据集

CoRL2026-CSI/table3_stateseeding_pnp

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,专注于机器人拾放任务,涉及so101_follower机器人。数据集包含100个episodes,总计32666帧,数据以parquet格式组织,分为训练集(全部episodes)。数据特征包括机器人状态(如关节位置)、动作、图像观察(顶部和左腕摄像头视频,分辨率480x640,10fps)、末端执行器位置、抓取器状态、技能和子任务的自然语言描述、目标位置、时间戳等。数据集适用于机器人学习研究,特别是状态引导和拾放操作。

This dataset was created using LeRobot and focuses on robotic pick-and-place tasks involving the so101_follower robot. It contains 100 episodes with a total of 32,666 frames, organized in parquet format and split into a training set (all episodes). Features include robot state (e.g., joint positions), actions, image observations (top and left wrist camera videos at 480x640 resolution, 10fps), end-effector position, gripper state, natural language descriptions for skills and subtasks, target positions, timestamps, and more. The dataset is suitable for robotics learning research, particularly state seeding and pick-and-place operations.

提供机构:
CoRL2026-CSI
搜集汇总
数据集介绍
CoRL2026-CSI/table3_stateseeding_pnp 数据集图片
构建方式
在机器人学习领域,高质量示教数据的采集通常依托标准化平台与统一流程。该数据集借助LeRobot框架,以so101_follower机械臂为采集载体,针对抓取放置任务完成系统性数据记录。采集过程遵循统一的任务设定,共生成100个完整回合,累计32666帧,每帧均同步记录关节位置与动作指令六维向量、末端执行器位姿、夹爪状态及多视角视觉信息,并附加技能层级与子任务层级的自然语言标注、验证性问题及目标位置,构成结构化的多模态示教序列。
特点
该数据集面向机器人精细操作研究,呈现出多模态融合与任务语义层次化的特点。视觉观测涵盖顶部与左腕两个视角,分辨率为480×640,帧率为10,便于策略学习中的空间感知建模。数据在传统状态-动作对基础上,进一步引入技能与子任务的分层标注,包括自然语言描述、验证问题、进度值和目标关节位姿,为语言条件策略与技能推理研究提供支撑。全部数据以Parquet列式存储,视频以h264编码压缩,兼顾读取效率与存储成本。
使用方法
使用者可借助LeRobot工具链直接加载该数据集,依据meta/info.json中定义的路径规则访问data目录下的Parquet文件及videos目录中的视频流。数据集默认划分train为0至100回合,适合用于模仿学习、视觉-语言-动作模型训练及技能验证任务。研究者可通过Hugging Face Spaces中的可视化工具在线浏览轨迹,或结合skill与subtask字段构建语言引导的分层策略,亦可利用goal_position字段进行目标条件策略评估与子任务进度预测研究。
背景与挑战
背景概述
在具身智能与机器人学习迅猛演进的当下,面向精细操作技能的可复现数据资源成为推动策略泛化的关键基石。该数据集由CoRL2026-CSI团队依托LeRobot框架构建,围绕so101_follower机械臂的抓取-放置任务,采集了100条轨迹、32666帧多模态观测,并首次系统性地引入状态播种(state seeding)与自然语言子任务标注机制。其核心研究问题在于如何借助状态分布的先验引导,缓解模仿学习中对初始条件敏感、技能迁移困难等痼疾,从而为视觉-语言-动作模型(如SmolVLA)提供更具结构化的训练信号。该工作为机器人操作技能的层次化表征与可验证学习提供了新的数据范式,对具身智能领域的可复现研究具有显著的推动作用。
当前挑战
该数据集所应对的领域问题,是机器人抓取-放置任务中状态分布偏移与技能语义割裂的双重困境:传统示教数据往往局限于固定初始构型,导致策略在非平稳环境中泛化乏力。构建过程中的挑战同样错综复杂,涵盖状态播种策略的设计与执行精度、多视角视频流与关节位姿的时空对齐、自然语言子任务与验证问题的语义一致性标注,以及goal_position在关节空间与笛卡尔空间之间的协同映射。此外,如何确保100条轨迹在状态空间中的覆盖广度与任务语义的层次完整性,亦构成数据质量与规模之间的核心张力。
常用场景
经典使用场景
在机器人学习领域,抓取与放置任务历来是检验感知与操控协同能力的试金石。table3_stateseeding_pnp数据集依托SO-101 Follower机械臂,以100条演示轨迹、逾三万帧的规模,为视觉-语言-动作模型的策略学习提供了经典场景。其最为典型的用法在于训练smolvla等端到端策略网络,使机器人依据顶部与左腕双视角图像,结合任务指令,完成从状态观测到六维关节动作的映射,从而习得状态播种式拾取放置技能。
实际应用
在实际应用中,该数据集可直接服务于仓储分拣、桌面整理与柔性装配等场景的机器人部署。基于SO-101 Follower平台采集的双目视觉与关节状态数据,能够迁移至同构或异构机械臂,支撑拾取放置任务的策略预训练与微调。自然语言技能标注与验证性问答字段,有助于构建人机交互式任务下达与执行确认流程,使操作人员以口语指令引导机器人完成目标物体的精准抓取与放置,提升自动化产线的柔性与效率。
衍生相关工作
围绕该数据集,后续研究可衍生出多条经典工作脉络。其一,基于技能进度与自然语言标注,可发展分层强化学习与技能发现方法,实现长程任务的自动分解。其二,利用验证性问答字段,可探索视觉问答驱动的策略自省与错误恢复机制。其三,结合目标关节位姿与末端笛卡尔位姿的双重标注,可开展跨模态动作表示学习与位姿回归研究。这些工作共同拓展了语言-视觉-动作融合在机器人操作中的理论边界与应用深度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务