遇见数据集

so101_table_sort_v2

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

该数据集是基于 LeRobot 框架创建的机器人操作数据集,适用于机器人模仿学习等任务。数据集包含来自 so_follower 机器人的动作与观测数据,共计75个episode,42382帧,涵盖8个不同任务。每个时间步包含6维动作向量(肩部、肘部、腕部、夹爪位置)和对应的6维观测状态(相同关节位置),以及来自手腕和前方两个摄像头的视频图像(分辨率480×640,3通道,帧率25fps,AV1编码)。数据存储为parquet文件和MP4视频文件,总大小约300MB(数据100MB,视频200MB)。所有数据默认划分为训练集。

This dataset is a robot manipulation dataset created based on the LeRobot framework, suitable for robot imitation learning tasks. It contains action and observation data from the so_follower robot, with a total of 75 episodes, 42,382 frames, covering 8 different tasks. Each timestep includes a 6-dimensional action vector (shoulder, elbow, wrist, gripper positions) and a corresponding 6-dimensional observation state (same joint positions), as well as video images from two cameras (wrist and front) with resolution 480×640, 3 channels, frame rate 25fps, AV1 encoding. The data is stored as parquet files and MP4 video files, totaling approximately 300MB (100MB data, 200MB video). All data is split into training set by default.

创建时间:
2026-07-31
原始信息汇总

数据集概述:so101_table_sort_v2

该数据集由 LeRobot 创建,遵循 Apache-2.0 许可证,主要面向机器人技术(Robotics)领域,用于描述机器人执行桌面分拣(table sort)任务的相关数据。

数据集基本信息

  • 任务类别:机器人技术 (Robotics)
  • 标签:LeRobot
  • 许可证:Apache-2.0
  • 首页链接:未提供
  • 论文链接:未提供

数据结构

该数据集包含机器人执行任务时的动作数据、状态数据和视觉观测数据,具体特征如下:

特征字段

  • action: 6维浮点数组,包含肩部水平旋转、肩部垂直旋转、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置
  • observation.state: 6维浮点数组,包含与动作字段相同的机器人关节状态信息
  • observation.images.wrist: 手部相机图像,分辨率为480x640x3
  • observation.images.front: 前部相机图像,分辨率为480x640x3
  • timestamp: 时间戳,浮点类型
  • frame_index: 帧索引,整型
  • episode_index: 回合索引,整型
  • index: 全局索引,整型
  • task_index: 任务索引,整型

视频参数

  • 编码格式:AV1
  • 像素格式:yuv420p
  • 帧率:25 FPS
  • 视频分辨:480x640

数据规模

  • 总回合数 (Episodes): 100
  • 总帧数 (Frames): 52,685
  • 总任务数 (Tasks): 8
  • 数据块大小 (Chunk Size): 1000
  • 数据集文件大小: 约100 MB
  • 视频文件大小: 约300 MB
  • 机器人类型: so_follower

数据集划分

  • 训练集 (Train):包含全部 100 个回合(0:100)

文件存储结构

  • 数据文件路径: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件路径: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

引用信息

数据集的 BibTeX 引用信息尚未提供。

搜集汇总
数据集介绍
so101_table_sort_v2 数据集图片
构建方式
该数据集名为so101_table_sort_v2,是在机器人操作领域背景下,通过LeRobot框架采集的高质量演示数据集。数据集的构建围绕so_follower机器人平台展开,共计包含100个操作片段,涵盖8种不同的任务类型,总帧数达52,685帧。每个片段以25帧每秒的频率记录了机器人的关节状态、6维动作指令以及从腕部和前部两个视角捕获的640×480分辨率RGB视频流。数据以Parquet格式存储元数据,视频则采用AV1编码,按chunk分块组织,便于高效访问和分布式处理。
使用方法
该数据集专为基于视觉的机器人操作任务设计,适用于训练端到端的模仿学习模型。使用者可借助LeRobot库及相关数据加载工具,通过指定数据路径和分块索引,轻松读取包含观测图像、机器人状态与动作序列的数据样本。数据集结构清晰,字段定义完整,便于进行自定义的数据预处理和增强。此外,数据集还提供了可视化工具,可在HuggingFace平台上直观浏览实例,便于研究者快速评估数据质量并调试模型,从而加速从数据到策略的迭代研究。
背景与挑战
背景概述
该数据集由研究者于近期创建,基于HuggingFace LeRobot框架,旨在推动机器人操作领域的模仿学习研究。数据集命名为so101_table_sort_v2,核心研究问题聚焦于机械臂在桌面场景下的物体分类与整理任务。数据采集自SO-101型机械臂(so_follower),包含100个操作回合,总计52685帧,涵盖8种不同任务,通过前置与腕部摄像头同步记录高保真视觉信息以及6维关节动作状态。数据集的构建采用Apache-2.0许可,便于学术与工业界广泛使用。作为机器人学习社区的重要资源,该数据集为验证模仿学习算法在精细操作任务中的泛化能力提供了标准化基准,对具身智能领域的发展具有显著推动作用。
当前挑战
该数据集所应对的领域挑战源自桌面物体分类整理任务的复杂性与动态性,要求机器人具备视觉感知、决策规划与精确操控的多维能力。在构建过程中,研究者面对诸多技术难题:首先,需确保多视角视频采集与动作状态记录的高精度同步,以保证数据时序一致性;其次,机械臂在真实物理环境中的交互导致动作轨迹多样性,增加了数据归一化与处理的难度;再次,为覆盖多样任务场景,需要精心设计任务变体与执行流程,避免数据偏差;此外,数据存储与压缩策略需在保证信息完整性的前提下实现高效性,最终数据集以视频(AV1编码)与parquet文件混合存储,大小约300MB,兼顾了实用性与可复现性。
常用场景
经典使用场景
该数据集是面向机器人操作学习领域的典范性数据集,专为双臂协同的物体分拣与排序任务而设计。数据集采集自SO-100机械臂(一款基于Follower配置的轻量化机器人平台),通过高频率(25帧/秒)记录六维关节状态与多视角视觉信息,涵盖100个完整演示片段,总计超过5万帧图像与状态数据。其在机器人模仿学习、行为克隆及视觉运动策略训练中扮演核心角色,为研究者提供了从原始感知到动作映射的标准化训练样本,尤其适用于验证端到端神经网络在精密操控任务中的泛化性能与鲁棒性。
解决学术问题
该数据集直面机器人领域长期存在的‘少样本迁移’与‘多任务泛化’困境,通过提供统一格式的高质量演示数据,解决了学术研究中数据碎片化与基准缺失的痛点。其结构化的多模态记录(关节角度、腕部与前置摄像头图像)使得研究者能够系统性探究视觉-运动耦合机制、时序依赖建模及策略跨场景迁移的学术命题。该数据集的发布推动了机器人学习社区从散落的自建数据向可复现、可比较的标准化基准的转变,为验证新型算法(如扩散策略、Transformer-based策略)在真实物理环境中的效能提供了坚实的实验基础。
实际应用
在实际应用中,该数据集为工业装配、仓储物流及服务机器人的智能化升级提供了直接支撑。基于此数据集训练的模型可迁移至具体任务场景,如自动化产线上的工件识别与有序摆放、智能仓库中的货物分拣与整理,以及家庭环境中物品归位等精细化操作。其采集的直观视觉特征与低维动作指令,降低了真实部署的工程门槛,使开发者能够快速迭代适应用户需求的定制化机器人操作方案,进而提升作业效率与操作安全性,加速机器人从实验室走向商业落地的进程。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操作中的桌面物体整理任务,通过双臂移动操作平台so_follower实现表格排序动作。研究前沿在于利用模仿学习和强化学习范式,在真实物理环境中训练智能体完成精细的物体分类与摆放。结合LeRobot框架,数据集为多模态感知(视觉与关节状态)与动作策略的联合学习提供了高质量的演示数据,推动了具身智能在动态、非结构化场景下的泛化能力研究。其包含的8个任务子集,覆盖了多种物体排列模式,有助于探索多任务学习与迁移策略,对于提升机器人自主决策以及人机协作效率具有重要的实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务