遇见数据集

so101_tidy-up-table

收藏
Hugging Face2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

该数据集使用 LeRobot 工具创建,是一个机器人控制相关的数据集,适用于机器人模仿学习或强化学习任务。数据集包含 13 个 episode,总计 11591 帧,数据以 parquet 文件格式存储,总数据文件大小为 100 MB,视频文件大小为 200 MB。数据采集自 so_follower 类型机器人,帧率为 30 fps。数据集仅包含训练集划分(0:13)。数据特征包括:动作(action)和观测状态(observation.state),均为 6 维浮点数组,对应机器人肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置;观测图像包括顶部摄像头(observation.images.top)和腕部摄像头(observation.images.wrist)的视频数据,分辨率均为 480x640,3 通道彩色视频,编码为 h264,像素格式为 yuv420p;此外,还包含时间戳(timestamp)、帧索引(frame_index)、episode 索引(episode_index)、索引(index)和任务索引(task_index)等元数据字段。

This dataset is created using the LeRobot tool and is related to robot control, suitable for robot imitation learning or reinforcement learning tasks. It contains 13 episodes, totaling 11591 frames, with data stored in parquet file format. The total data file size is 100 MB, and the video file size is 200 MB. The data is collected from a so_follower type robot at a frame rate of 30 fps. The dataset only includes a training set split (0:13). Data features include: action and observation.state, both 6-dimensional floating-point arrays corresponding to robot shoulder translation, shoulder elevation, elbow flexion, wrist flexion, wrist rotation, and gripper position; observation images include video data from a top camera (observation.images.top) and a wrist camera (observation.images.wrist), both with a resolution of 480x640, 3-channel color video, encoded as h264 with pixel format yuv420p; additionally, it includes metadata fields such as timestamp, frame_index, episode_index, index, and task_index.

创建时间:
2026-05-26
原始信息汇总

数据集:so101_tidy-up-table

该数据集是一个用于机器人(Robotics)任务的数据集,由 LeRobot 工具创建,采用 Apache-2.0 许可证。

基本信息

  • 任务类型:机器人(Robotics)
  • 机器人类型:so_follower
  • 总片段数(Episodes):17
  • 总帧数(Frames):15,148
  • 总任务数:1
  • 帧率(FPS):30
  • 数据文件大小:约 100 MB
  • 视频文件大小:约 200 MB
  • 数据集划分
    • 训练集(Train):片段 0 到 16(共 17 个片段)

数据结构

数据集以 chunk 和 file 的方式组织,parquet 文件存放数据,mp4 文件存放视频。

  • 数据路径data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

特征(Features)

每个样本包含以下特征:

特征名称 数据类型 形状 描述/内容
action float32 (6,) 机器人动作:肩部、肘部、腕部(flex/roll)及夹爪位置
observation.state float32 (6,) 机器人状态(观测):对应各关节位置
observation.images.top video (480, 640, 3) 顶部摄像头画面(H264编码,30fps,无音频)
observation.images.wrist video (480, 640, 3) 腕部摄像头画面(H264编码,30fps,无音频)
timestamp float32 (1,) 时间戳
frame_index int64 (1,) 帧索引
episode_index int64 (1,) 所属片段索引
index int64 (1,) 样本索引
task_index int64 (1,) 任务索引

动作与状态的具体维度

  • shoulder_pan.pos
  • shoulder_lift.pos
  • elbow_flex.pos
  • wrist_flex.pos
  • wrist_roll.pos
  • gripper.pos

可视化

可以通过 LeRobot 可视化空间 在线查看此数据集的内容。

搜集汇总
数据集介绍
so101_tidy-up-table 数据集图片
构建方式
该数据集基于LeRobot框架构建,专注于机器人桌面整理任务。数据采集过程由so_follower机器人执行,通过遥操作或预设策略完成“tidy-up-table”这一单一任务。共计17个演示片段(episodes),累积15148帧时空序列数据。数据以Parquet格式存储动作与状态,视频则以H.264编码的MP4文件保存,分别从顶部和腕部两个视角捕捉场景动态,实现了多维感知信息的同步记录与结构化组织。
特点
数据集核心特色在于其高度结构化的多模态信息编排。每个时间步均包含6维关节空间的动作指令与状态观测,涵盖shoulder_pan、shoulder_lift、elbow_flex、wrist_flex、wrist_roll及gripper的位姿数据。双视角视觉输入(顶部图像与腕部图像)均达到480×640分辨率,帧率为30 FPS,为模仿学习与行为克隆提供了丰富的时空上下文。此外,数据按1000帧分块存储,便于分布式加载与高效训练。
使用方法
数据集的使用依托于LeRobot生态系统,用户可通过HuggingFace提供的可视化工具在线预览样本内容。在本地开发环境中,建议利用LeRobot的Dataset API加载Parquet文件与对应视频,自动化处理时间戳对齐与帧索引映射。训练时,可将action序列作为监督信号,以observation.state与observation.images作为输入,构建端到端的机器人操控策略。由于数据已预设train:0-17的拆分,可直接用于模型训练与验证循环。
背景与挑战
背景概述
在机器人学习领域,模仿学习(Imitation Learning)凭借其从人类演示中习得复杂技能的能力,已成为突破传统编程局限的重要范式。由witsense-ai团队构建的so101_tidy-up-table数据集,诞生于2025年初,聚焦于桌面整理这一典型家务场景,旨在为机器人提供从人类示范中学习有序化操作的基础训练资源。该数据集基于LeRobot框架采集,包含17个完整演示片段、共计15148帧(30FPS)的高频动作与图像数据,机器人类型为so_follower,动作空间涵盖肩部、肘部、腕部及夹爪的六自由度控制。尽管规模尚小,但其标准化格式(Parquet数据+MP4视频)与Apache-2.0许可协议,为机器人操作技能的数据共享与复现研究树立了可拓展的参考范例。
当前挑战
该数据集所解决的领域问题是桌面环境的自主整理任务,其核心挑战在于:1)动作策略的泛化性——17个演示片段难以覆盖物体初始位置、形状及空间布局的无限变化,模型需从有限示范中提取可迁移的整理规律,而非机械模仿固定轨迹;2)高维状态表征的可靠性——纯视觉观察(顶部与腕部双摄像头,640×480分辨率的H.264编码)易受光照、遮挡及视点变化干扰,需与夹爪状态等低维传感互补;3)构建过程中的物理不确定性——真实机械臂执行中,物体抓取滑动、夹爪力反馈波动等非理想因素会引入演示数据噪声,对采集设备的校准精度与采样频率(30Hz)构成考验。
常用场景
经典使用场景
在机器人操作研究中,桌面整理任务是最具代表性的基础技能之一,它要求机械臂在非结构化环境中灵巧地拾取、移动和摆放物体。so101_tidy-up-table数据集正是为这一场景量身打造,提供了来自so_follower机器人的17个完整演示片段,包含15148帧以30帧每秒采样的动作序列与视觉观测。每个轨迹详尽记录了六自由度关节位置(肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部滚动及夹爪开合)以及顶部和腕部两个视角的实时视频流,为模仿学习与行为克隆算法提供了高质量的多模态训练素材。研究者可借助该数据集让机器人从人类示教中学习如何适应不同物体摆放策略,从而在杂乱桌面上完成整洁有序的归位操作。
解决学术问题
该数据集精准回应了机器人学习领域中一个关键学术挑战——如何有效收集并利用真实的物理操作演示,以推动从感知到动作的端到端策略学习。现有研究普遍受困于数据采集成本高昂且任务单一,难以在有限样本中泛化出鲁棒的控制策略。so101_tidy-up-table通过提供标准化、高帧率且包含多视角视觉信息的机器人物理交互数据,使学术界能够系统性地探索动作空间与视觉特征的联合表征。这解决了过去因数据缺失而难以开展的可重复性实验问题,为验证最新算法(如扩散策略、隐式行为克隆)在真实桌面整理任务上的性能提供了可靠基准,进而推动机器人灵巧操作从仿真研究向真实部署迈出关键一步。
衍生相关工作
围绕so101_tidy-up-table数据集已催生出若干富有前瞻性的衍生研究工作。基于其规范的LeRobot格式和多模态观测结构,研究者可将其无缝嵌入最先进的模仿学习框架中,探索条件变分自编码器或基于Transformer的动作扩散模型在桌面场景的表现。该数据集的细粒度关节角度记录还启发了一系列关于动作原始度量的元学习研究,旨在使机器人从少量演示中快速适应新物体的形状与摆放规则。进一步地,顶部与腕部视觉流的同步特性为跨视角特征对齐和视觉重排策略提供了天然测试床,涌现出结合对比学习与因果推断的工作,用于解释机器人操作决策的内在逻辑。这些贡献共同拓展了机器人少样本操作学习与可解释人工智能的前沿边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务