遇见数据集

so101_dice_to_teacup

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

该数据集是使用LeRobot框架创建的机器人操作数据集,主要用于机器人模仿学习、行为克隆等任务。数据集包含80个episode,共33808帧,总任务数为1。每个episode记录了机器人(so_follower类型)的6维关节动作(shoulder_pan、shoulder_lift、elbow_flex、wrist_flex、wrist_roll、gripper位置)和对应的状态观测,同时提供前视和顶视两个视角的摄像头视频(分辨率480×640,AV1编码,30fps)。数据以parquet文件存储,视频以mp4文件存储,总数据大小约100MB,视频大小约200MB。所有数据默认划分为训练集(episode 0-79)。数据集名称中的“pickplace”暗示其主要涉及拾取和放置操作。

This robotic manipulation dataset was developed using the LeRobot framework, and is mainly used for tasks such as robot imitation learning and behavioral cloning. The dataset contains 80 episodes, totaling 33,808 frames, with a total of 1 unique task. Each episode records the 6-dimensional joint actions (shoulder_pan, shoulder_lift, elbow_flex, wrist_flex, wrist_roll, and gripper position) of the so_follower-type robot, along with corresponding state observations. Additionally, it provides camera videos from two perspectives: front view and top view, with a resolution of 480×640, AV1 encoded, and 30 fps. The structured data is stored in Parquet files, while the videos are stored in MP4 files. The total size of the structured data is approximately 100 MB, and the total size of the video files is approximately 200 MB. All data is by default split into the training set (episodes 0-79). The term "pickplace" in the dataset name indicates that it primarily focuses on pick-and-place manipulation tasks.

创建时间:
2026-08-02
原始信息汇总

数据集概述

  • 数据集名称: so101_dice_to_teacup
  • 数据集地址: https://huggingface.co/datasets/zhangdebiao/so101_dice_to_teacup
  • 许可证: Apache-2.0
  • 任务类别: 机器人 (robotics)
  • 标签: LeRobot

数据集结构

该数据集由 LeRobot 创建,数据以 Parquet 格式存储,路径为 data/*/*.parquet

数据规模

  • 总片段数 (Episodes): 80
  • 总帧数 (Frames): 33,808
  • 总任务数 (Tasks): 1
  • 数据文件大小: 约 100 MB
  • 视频文件大小: 约 200 MB
  • 训练集划分: train 包含全部 80 个片段(即 0:80

特征信息

数据集的每个样本包含以下特征:

  • action (float32, 形状 [6]): 机器人动作,包含6个关节位置(shoulder_pan, shoulder_lift, elbow_flex, wrist_flex, wrist_roll, gripper)
  • observation.state (float32, 形状 [6]): 机器人状态观测,同样包含6个关节位置
  • observation.images.front (video, 480×640×3, 30fps, AV1编码): 前方摄像头图像
  • observation.images.top (video, 480×640×3, 30fps, AV1编码): 顶部摄像头图像
  • timestamp (float32, 形状 [1]): 时间戳
  • frame_index (int64, 形状 [1]): 帧索引
  • episode_index (int64, 形状 [1]): 片段索引
  • index (int64, 形状 [1]): 整体索引
  • task_index (int64, 形状 [1]): 任务索引

机器人类型

  • 机器人类型: so_follower(SO 系列跟随机器人)

数据采集参数

  • 采集帧率 (fps): 30
  • LeRobot 代码版本: v3.0
  • 视频编码: AV1
  • 视频像素格式: yuv420p
  • CRF 值: 30

引用信息

数据集的 BibTeX 引用信息目前未提供(标注为 [More Information Needed])。

搜集汇总
数据集介绍
so101_dice_to_teacup 数据集图片
构建方式
该数据集源自机器人操作任务,通过LeRobot框架采集,聚焦于将骰子放入茶杯的精细操作。数据采集由SO-100机械臂执行,包含80个演示回合,总计33,808帧,以30帧每秒的频率记录。每个回合同步存录六维关节角度指令(肩部、肘部、腕部及夹爪位置)与状态观测,并辅以正前方及俯视双视角的高清视频流(480×640分辨率,AV1编码)。数据以parquet格式分块存储,视频单独归档,并附带元数据索引,便于高效加载与复现。
特点
此数据集的核心特色在于其多模态同步性与结构完整性。它融合了低维本体感觉数据(动作指令与环境状态)与高维视觉观测,为模仿学习提供了丰富的表征空间。采集环境配置了双固定相机,通过不同角度捕捉操作细节,增强了视觉多样性与鲁棒性。数据规模虽为中等,但涵盖80个完整回合,足够训练初步的技能策略。此外,数据集遵循统一的LeRobot数据规范,附有结构化的元数据描述,确保了在机器人学习框架中的即插即用兼容性,降低了预处理门槛。
使用方法
该数据集专为基于模仿学习的机器人技能习得而设计,可直接用于训练视觉-运动策略。使用者可借助LeRobot库加载数据流,获取同步的动作观测序列和视频帧。典型应用流程包括构建端到端神经网络,以当前观测图像及关节状态为输入,预测下一时刻的动作向量。数据集预设了训练集划分,便于进行策略优化与效果验证。对于研究社区而言,该数据也可作为跨任务元学习或领域随机化的基础,推动操作技能的泛化研究。
背景与挑战
背景概述
so101_dice_to_teacup数据集诞生于机器人学习领域蓬勃发展的前沿时期,由研究团队借助HuggingFace的LeRobot框架精心构建,隶属于so100系列机械臂操控任务。该数据集聚焦于将骰子精准置入茶杯的精细操作,旨在为模仿学习与强化学习算法提供高质量的专家示范数据。数据集录制于2026年8月2日,包含80个演示回合、总计33808帧的高频(30Hz)多视角视觉与本体感觉序列,覆盖了六维关节空间的动作指令。凭借Apache-2.0许可的开放性,它为机器人操作技能的迁移学习、策略泛化及多模态感知融合研究提供了标准化基准,有力推动了具身智能在精细抓取与放置任务中的发展。
当前挑战
该数据集直面精细操作领域的核心挑战,即如何在非结构化环境中实现稳健的物体操控。骰子的小尺寸与易滚动性对抓取精度和动态响应提出严苛要求,而环境光变化、相机视角差异及机械臂运动学误差进一步加剧了视觉感知与动作执行的耦合难题。在数据构建层面,团队需同步完成多相机标定、高频状态采样与动作同步,并通过80回合的有限示教覆盖多样化起始位姿与潜在失败模式,同时确保标定数据与真实物理环境的一致性。此外,LeRobot框架下的数据压缩编码需在不损耗关键空间细节的前提下平衡存储效率与信息保真度,为后续算法的可靠训练提供数据基础。
常用场景
经典使用场景
该数据集so101_dice_to_teacup专为机器人操作任务中的模仿学习设计,记录了机械臂将骰子放入茶杯的完整动作序列。数据采集频率为30Hz,包含80个演示episode,每个episode涵盖多视角视觉观测(前置摄像头与顶部摄像头)及6维关节状态信息。此类数据集是训练基于视觉的运动策略(如扩散策略、行为克隆)的经典素材,研究者可基于此数据训练机器人学习精细的抓取、移动与释放操作,评估算法在真实世界中的泛化性能。
解决学术问题
此数据集为机器人领域中的‘少样本模仿学习’与‘多模态感知融合’提供了标准基准。它解决了模仿学习研究中数据稀缺、传感器同步与动作标注困难等核心问题,使研究者能够聚焦于算法设计,而非繁琐的数据采集。通过标准化episode结构与多视角视觉输入,它推动了视觉-动作联合建模的研究进展,为验证新型策略在有限演示下的学习效率与鲁棒性提供了可靠平台,对具身智能学术发展具有重要意义。
衍生相关工作
该数据集衍生的相关工作集中于模仿学习算法的改进与评估,如基于扩散策略的动作生成、基于Transformer的决策Transformer(DT)以及行为克隆(BC)的变体。Hugging Face LeRobot工具链的集成,促使研究者开发了多种跨任务的数据预处理与增强方法,并推动了统一基准的开创,如Comparison of Imitation Learning Methods。此外,该数据集亦催生了关于多视角融合、数据效率提升以及域随机化的深度研究,为后续更复杂任务的数据集构建奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务