遇见数据集

bamb2026_so101_pickplace_vision

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

该数据集是一个用于机器人操作任务的数据集,使用LeRobot框架创建。它包含72个完整的操作序列(episodes),总计35298个数据帧,涵盖单一任务类型。数据以分块形式组织,每个数据块包含1000帧。数据集总大小为300MB(其中数据文件100MB,视频文件200MB),采用30fps的帧率记录。关键字段包括:动作(action)字段记录6个关节(肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转、夹爪)的位置信息;状态观测(observation.state)字段同样包含这6个关节的位置信息;视觉观测(observation.images.wrist)字段提供腕部摄像头的RGB视频流,分辨率为480x640,3通道;此外还包含时间戳(timestamp)、帧索引(frame_index)、序列索引(episode_index)、全局索引(index)和任务索引(task_index)等元数据字段。数据集专门针对so_follower型机器人设计,适用于机器人模仿学习、强化学习、视觉运动控制等研究任务,并已划分为训练集(包含所有72个序列)。

This dataset is designed for robotic manipulation tasks and is created using the LeRobot framework. It contains 72 complete operation sequences (episodes), totaling 35,298 data frames, covering a single task type. The data is organized in chunks, with each chunk containing 1,000 frames. The total dataset size is 300MB (with data files at 100MB and video files at 200MB), recorded at a frame rate of 30fps. Key fields include: the action field records position information for 6 joints (shoulder translation, shoulder lift, elbow bend, wrist bend, wrist rotation, gripper); the state observation (observation.state) field also contains position information for these 6 joints; the visual observation (observation.images.wrist) field provides an RGB video stream from a wrist-mounted camera with a resolution of 480x640 and 3 channels; additionally, it includes metadata fields such as timestamp, frame_index, episode_index, index, and task_index. The dataset is specifically designed for the so_follower type robot and is suitable for research tasks in robot imitation learning, reinforcement learning, and visual-motor control. It has been divided into a training set (containing all 72 sequences).

创建时间:
2026-07-18
原始信息汇总
  • 数据集名称:bamb2026_so101_pickplace_vision
  • 许可证:Apache-2.0
  • 任务类型:机器人(Robotics)
  • 标签:LeRobot
  • 数据集规模
    • 总片段数:72
    • 总帧数:35,298
    • 总任务数:1
    • 数据文件大小:100 MB
    • 视频文件大小:200 MB
    • 帧率:30 FPS
  • 机器人类型:so_follower
  • 数据拆分
    • 训练集:片段 0 至 71(共 72 个片段,无验证/测试集)
  • 数据集结构
    • 数据路径data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
    • 视频路径videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
    • 特征
      • 动作(action):6维连续控制(shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos),浮点32
      • 观测状态(observation.state):6维(与动作空间相同),浮点32
      • 观测图像-手腕摄像头(observation.images.wrist):视频,分辨率 480×640,3通道,编码 AV1,FPS 30
      • 时间戳(timestamp):浮点32,形状 1
      • 帧索引(frame_index):int64,形状 1
      • 片段索引(episode_index):int64,形状 1
      • 索引(index):int64,形状 1
      • 任务索引(task_index):int64,形状 1
  • 用途:该数据集用于机器人拾取和放置任务(pick and place),包含手腕摄像头视觉观察和机器人关节状态/动作记录。数据集由 LeRobot 框架创建,可可视化展示。
搜集汇总
数据集介绍
bamb2026_so101_pickplace_vision 数据集图片
构建方式
该数据集基于LeRobot框架构建,专为机器人操作任务设计,聚焦于视觉引导的拾取与放置场景。数据采集自SO-100系列机械臂的从动端(so_follower),通过记录机械臂在单一任务下的运动轨迹与视觉信息,构建了一个包含72个演示回合、总计35298帧的高质量数据集。每个回合均以30帧/秒的速率同步采集6维关节动作指令(包括肩部、肘部、腕部及夹爪的位置)、对应的6维状态观测数据,以及来自腕部摄像头的640×480像素RGB视频流。数据以Parquet格式存储,视频采用AV1编码压缩,整体数据与视频文件大小分别约为100MB和200MB,结构清晰,便于高效加载与处理。
使用方法
用户可通过LeRobot库便捷地加载与可视化该数据集,只需指定路径`nisheet0/bamb2026_so101_pickplace_vision`即可访问。数据集提供默认配置,自动索引所有Parquet文件与对应视频。使用时,建议将数据分为训练集与验证集,例如取前60个回合用于训练,后12个回合用于评估。借助LeRobot的迭代器或DataLoader,可高效获取每帧的动作向量(6维)、状态向量(6维)及腕部图像(480×640×3),并利用时间戳与帧索引对齐时序。初学者可通过Hugging Face提供的可视化界面直观查看数据样本,以便理解任务结构与机械臂行为模式。
背景与挑战
背景概述
该数据集由研究者在LeRobot框架下创建,聚焦于机器人操作领域的“拾取与放置”基础任务,旨在为机器人学习提供高质量的视觉-动作序列数据。数据集包含72个演示片段,总计超过35000帧,记录了一款配备腕部摄像头的SO-100型从动机械臂执行单一任务时的关节角度指令与图像观测。通过标准化格式存储的6自由度动作和状态信息,为模仿学习与策略优化研究提供了可复用的基准资源,推动了机器人从感知到动作映射的端到端学习范式发展。
当前挑战
数据集涉及的领域挑战在于解决机器人精细操作中的泛化难题,包括如何从有限演示中提取鲁棒的动作策略以适应物体位置、形状和光照的变化,以及如何缓解视觉观测与动作执行之间的不确定性。构建过程中面临的关键挑战包括:确保多个演示片段中任务执行的一致性,避免人为操作偏差;平衡动作序列的时空连续性以维持数据质量;在有限GPU资源下高效完成高帧率视频与密集关节数据的同步采集与存储,最终将海量数据压缩为100MB的系统化格式,同时保留可扩展性与可复现性。
常用场景
经典使用场景
在机器人操作领域,bamb2026_so101_pickplace_vision数据集为模仿学习与行为克隆范式提供了宝贵的训练素材。该数据集收录了72个抓取与放置任务的完整演示轨迹,每段轨迹均包含高精度六维关节状态序列(肩关节、肘关节、腕关节及夹爪位置)与同步采集的腕部RGB视频流。研究者可通过视觉-运动联合建模,利用30Hz的密集采样频率捕捉人类示教过程中的精细操作策略,使智能体习得从像素到关节指令的端到端映射关系。这种标准化数据格式尤其适合训练面向非结构化环境的抓取技能,为后续迁移至真实协作机器人平台奠定基础。
解决学术问题
该数据集针对机器人精细操作中数据稀疏性与泛化能力薄弱的学术困境提供了系统性解决方案。传统方法依赖手工设计的特征或规则,难以建模连续动作空间下的多模态感知-运动耦合关系。通过提供高时频的视觉与运动对齐数据,该资源使研究者能够探索视觉特征与关节变量间的潜在流形结构,推动基于深度网络的运动规划在遮挡、光照变化等复杂条件下的鲁棒性研究。其重要意义在于构建了可复现的基准测试范式,促进了从简单示教到自适应策略生成的跨场景迁移方法论发展。
实际应用
在工业自动化与精密装配领域,该数据集展现出了显著的实践价值。基于其视觉-动作联合表征训练的模型可部署于协作机器人,实现电子元件分拣、药品分装及小型零件装配等重复性作业的自动化。腕部摄像头的第一人称视角数据使机器人能够动态适应工件位置的微小偏移,结合力位混合控制策略完成高精度对接任务。此外,该数据集的Apache-2.0宽松许可特性降低了企业部署门槛,便于生产环境中通过少样本微调快速适配新工件的操作需求,缩短产线换型周期。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操作领域的拾放(pick-and-place)任务,采用视觉引导的模仿学习范式,代表当前具身智能研究的前沿方向。随着LeRobot等开源框架的普及,基于低成本机械臂(如SO-101)的精细化操作数据收集成为热点,本数据集通过72个示范片段与35298帧高保真视频-状态对,为训练端到端策略提供了标准化基准。其影响力在于推动机器人从固定程序向数据驱动自主决策的转型,尤其在工业柔性装配、仓储物流等场景中具有显著应用价值,同时为跨本体迁移学习与多任务泛化研究奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务