遇见数据集

witsense-ai/so101_tidy-up-table

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,是一个机器人学数据集,专注于机器人控制任务。数据集包含17个训练episodes,总计15148帧,涉及1个具体任务(例如整理桌子)。数据以parquet文件格式存储,视频文件为mp4格式。特征包括:动作(6个关节位置:肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转、夹爪位置)、状态观察(与动作相同的6个关节位置)、顶部摄像头和腕部摄像头的图像观察(均为480x640分辨率、3通道RGB视频,帧率30fps),以及时间戳、帧索引、episode索引等元数据。机器人类型为so_follower,适用于机器人模仿学习或强化学习场景。

This dataset was created using LeRobot and is a robotics dataset focused on robot control tasks. It contains 17 training episodes, totaling 15148 frames, and involves 1 specific task (e.g., tidying up a table). The data is stored in parquet format, with video files in mp4 format. Features include: action (6 joint positions: shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, gripper position), observation.state (same 6 joint positions as action), observation images from top and wrist cameras (both 480x640 resolution, 3-channel RGB video at 30fps), and metadata such as timestamp, frame index, episode index, etc. The robot type is so_follower, suitable for robot imitation learning or reinforcement learning scenarios.

提供机构:
witsense-ai
搜集汇总
数据集介绍
witsense-ai/so101_tidy-up-table 数据集图片
构建方式
so101_tidy-up-table数据集基于LeRobot框架构建,旨在记录机器人执行桌面整理任务的物理交互过程。数据采集依托so_follower型机器人平台,通过遥操作手段完成17个完整演示回合,共计捕获15148帧连续状态信息。每回合数据以1000帧为一个数据块进行分割,采用Parquet格式存储动作与状态序列,同时将视觉观测以H.264编码的30帧/秒视频保存。数据架构清晰定义了动作空间、关节状态及多视角图像等特征,并采用统一的时间戳与帧索引对齐多模态信号。
使用方法
该数据集以Apache-2.0许可证发布,便于研究社区共享与扩展。使用者可通过HuggingFace数据集加载接口直接读取Parquet格式的帧序列与视频文件,结合LeRobot提供的可视化工具进行数据预览。在模型训练中,数据集已预设训练集分割,可直接用于模仿学习或离线强化学习流程。推荐研究者利用其多模态特征进行视觉-运动联合建模,或通过时序对齐特性实现动作序列的预测与规划。
背景与挑战
背景概述
so101_tidy-up-table数据集由witsense-ai团队基于LeRobot框架创建,专注于机器人操作领域的模仿学习任务。该数据集于近期发布,旨在通过17个演示片段、共计15148帧的高频(30 FPS)观测数据,训练机器人执行桌面整理任务。数据采集采用so_follower型机器人,包含6自由度关节位置动作及状态信息,并配备顶部与腕部双视角640×480视频流。作为机器人学习领域的基础资源,该数据集为少样本模仿学习提供了标准化训练范本,推动了从人类演示到机器人泛化操作的研究进程。
当前挑战
该数据集解决的核心领域问题是如何通过少量演示(仅17条轨迹)使机器人掌握可泛化的桌面整理技能,模仿学习在低数据量下易陷入过拟合或对未见场景的适应能力不足。构建过程中面临的挑战包括:双视角视频(顶部与腕部)的时空同步与校准,确保状态与动作数据在30 FPS下的严格对齐;以及在高维连续动作空间(6自由度关节)中有效捕捉人类演示的细微操控策略。此外,数据规模有限(共100MB的parquet及200MB视频)对模型鲁棒性提出了更高要求,需借助数据增强或预训练等方法缓解稀缺性带来的泛化瓶颈。
常用场景
经典使用场景
在机器人操作与模仿学习领域,so101_tidy-up-table数据集成为了一项聚焦于桌面整理任务的珍贵资源。该数据集通过LeRobot框架采集,包含了由“so_follower”机器人执行的17个完整演示片段,累计帧数超过1.5万帧,并以30帧/秒的频率记录了机械臂六自由度关节动作及顶部、腕部双视角高清视频。其经典使用场景在于训练基于视觉的模仿学习模型,使机器人学会从杂乱桌面中精准识别并抓取指定物品,随后将其归位至合理位置,从而完成“收拾桌面”这一具有高度实用价值的复合操作。研究人员可借助该数据集中的动作序列与观测状态,构建端到端的策略网络,让机器人掌握从感知到执行的完整闭环。
解决学术问题
该数据集核心解决的是机器人领域长期存在的“精细操作泛化”与“非结构化环境适应”两大学术难题。在传统研究中,机器人桌面整理任务常受困于物品位置随机、光照变化、抓取姿态多样等挑战,导致策略泛化能力薄弱。so101_tidy-up-table通过提供包含多角度视觉与精确关节状态的高质量演示数据,为研究视觉-运动耦合机制、动作序列预测以及策略迁移提供了标准化基准。它的出现推动了模仿学习算法在部分可观测、高自由度场景下的评测与改进,尤其促使学界关注如何利用小样本演示实现鲁棒的技能习得,对理解机器人自主整理行为的底层逻辑具有深远影响。
实际应用
在实际应用层面,so101_tidy-up-table数据集直接赋能于服务机器人与家庭自动化系统的开发。基于该数据集训练的模型可被部署至家庭、办公室或实验室等环境中,使机器人能够自动识别散落的工具、文具或餐具,并执行收纳归位操作。例如,在智能家居场景中,配备该技能的机器人可辅助老年人或行动不便者完成桌面整洁维护;在工业领域,类似技术可延伸至零件分拣与工位清理,提升生产线的柔性自动化水平。数据集所包含的标准化动作空间与视觉输入设计,还为机器人技能跨场景迁移提供了便捷接口,降低了实际部署中数据采集与模型适配的成本。
数据集最近研究
最新研究方向
在机器人操作领域的具身智能研究中,数据驱动的模仿学习正成为突破复杂任务泛化瓶颈的关键路径。so101_tidy-up-table数据集聚焦于桌面整理这一典型家居场景,借助LeRobot框架采集了包含17个演示回合、逾1.5万帧的高频运动与视觉数据。该数据集通过双臂协作机器人so_follower的六自由度关节动作与顶视、腕部双摄像头视频流,为学习精细操作策略提供了多模态对齐样本。当前,机器人领域的热点事件如开源具身智能生态的构建、大规模人机交互数据的生成范式,均与此类高保真操作数据集紧密相关。so101_tidy-up-table的意义在于它能够支撑研究者探索少样本模仿学习、动作时序预测以及视觉-运动联合表征等前沿方向,从而推动机器人从固定编程向自适应环境交互的实质性跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务