遇见数据集

eval_smolvla-so101-4tasks-aug_sort_25

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是一个机器人控制数据集,使用LeRobot工具创建,包含so_follower类型机器人的演示数据。总共有19个完整的情节(episodes),共计57763帧数据,涵盖1个任务。数据采用parquet文件格式存储,总大小约100MB,同时包含对应的视频文件,总大小约200MB。数据集包含多模态观测和控制信号:动作空间为6维浮点数组,控制机器人的6个关节位置(肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转、夹爪位置);状态观测为与动作空间对应的6维关节位置状态;视觉观测包括两个摄像头(camera1和camera2)采集的彩色视频,分辨率480×640,帧率30fps,3通道(RGB);时序信息包括时间戳、帧索引、情节索引、数据索引和任务索引。所有数据均划分为训练集,没有单独的验证集或测试集,适用于机器人模仿学习、强化学习、视觉运动控制等任务的研究和开发,采用Apache-2.0许可证发布。

This dataset is a robot control dataset created using the LeRobot tool, containing demonstration data for the so_follower type robot. It consists of 19 complete episodes, totaling 57,763 frames of data, covering 1 task. The data is stored in the parquet file format with a total size of approximately 100MB, along with corresponding video files totaling about 200MB. The dataset includes multimodal observations and control signals: the action space is a 6-dimensional floating-point array controlling the robots 6 joint positions (shoulder translation, shoulder elevation, elbow flexion, wrist flexion, wrist rotation, gripper position); the state observation corresponds to the 6-dimensional joint position state matching the action space; visual observations consist of color videos captured by two cameras (camera1 and camera2) with a resolution of 480×640, a frame rate of 30fps, and 3 channels (RGB); temporal information includes timestamps, frame indices, episode indices, data indices, and task indices. All data is divided into a training set, with no separate validation or test sets, making it suitable for research and development in tasks such as robot imitation learning, reinforcement learning, and visual-motor control. The dataset is released under the Apache-2.0 license.

创建时间:
2026-07-20
原始信息汇总

数据集概况

  • 数据集名称: eval_smolvla-so101-4tasks-aug_sort_25
  • 数据集链接: https://huggingface.co/datasets/hjkso1406/eval_smolvla-so101-4tasks-aug_sort_25
  • 许可证: Apache-2.0
  • 任务类别: 机器人技术 (robotics)
  • 标签: LeRobot

数据集用途

该数据集用于机器人控制任务,基于 LeRobot 框架构建,数据集格式遵循 LeRobot 规范。

数据集规模

  • 总片段数 (episodes): 20
  • 总帧数 (frames): 60,989
  • 总任务数: 1
  • 帧率 (fps): 30
  • 数据文件大小: 约 100 MB
  • 视频文件大小: 约 200 MB
  • 块大小 (chunks): 1000

数据分割

  • 训练集: 0 至 19 (共 20 个片段)

机器人类型

  • 机器人: so_follower

数据特征

动作 (action)

  • 数据类型: float32
  • 形状: [6]
  • 维度含义: shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos

观察状态 (observation.state)

  • 数据类型: float32
  • 形状: [6]
  • 维度含义: shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos

图像观察 (observation.images)

  • 相机1 (camera1)
    • 数据类型: 视频 (video)
    • 分辨率: 480x640 像素
    • 通道数: 3
    • 编码格式: av1
    • 像素格式: yuv420p
    • 帧率: 30 fps
    • 是否深度图: 否
  • 相机2 (camera2)
    • 数据类型: 视频 (video)
    • 分辨率: 480x640 像素
    • 通道数: 3
    • 编码格式: av1
    • 像素格式: yuv420p
    • 帧率: 30 fps
    • 是否深度图: 否

其他特征

  • timestamp: float32, 形状 [1]
  • frame_index: int64, 形状 [1]
  • episode_index: int64, 形状 [1]
  • index: int64, 形状 [1]
  • task_index: int64, 形状 [1]

文件结构

  • 数据路径: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

代码库版本

  • codebase_version: v3.0
搜集汇总
数据集介绍
eval_smolvla-so101-4tasks-aug_sort_25 数据集图片
构建方式
该数据集基于LeRobot框架构建,聚焦于机器人操控领域。数据由SO-100型从属机器人(so_follower)采集,包含20个完整轨迹(episode),总计60,989帧,帧率为30 FPS。每个轨迹被均匀划分为1000帧的块(chunk),并以Parquet格式存储动作与状态数据,同时使用AV1编码的视频文件记录两个摄像头视角(camera1与camera2)的视觉信息,画面分辨率为480×640像素。所有数据仅划分为训练集,不设验证或测试集,适用于监督学习下的策略优化。
使用方法
借助LeRobot库的标准化接口,用户可便捷加载数据集。通过`from lerobot.common.datasets.lerobot_dataset import LeRobotDataset`导入后,指定数据集配置名称`default`即可访问。数据以字典形式返回,包含`action`、`observation.state`、`observation.images.camera1`及`observation.images.camera2`等键值。推荐将视觉帧输入为图像张量,关节状态与动作向量则直接用于模仿学习或强化学习训练。此外,Hugging Face Spaces提供可视化工具,便于交互式审查数据集内容。
背景与挑战
背景概述
该数据集由LeRobot社区创建,旨在为机器人学习领域提供标准化的模仿学习训练与评估资源。基于SO-100机械臂平台,数据集聚焦于单任务下的6自由度动作序列,包含20个完整轨迹片段与超过6万帧的观测数据。通过双视角摄像头(分辨率640×480,帧率30fps)与关节状态信息,数据集精确记录了机械臂从肩部到夹爪的完整运动链。其核心研究问题在于验证视觉-动作联合表征在少样本场景下的泛化能力,为机器人技能学习提供可复现的基准。作为LeRobot生态的组成部分,该数据集推动了开源机器人社区在模仿学习领域的标准化进程,为多任务与长时域策略研究奠定了数据基础。
当前挑战
领域层面,机器人模仿学习面临从高维视觉输入到连续动作空间的精确映射难题,现有方法常受限于数据效率低下与跨场景泛化不足,尤其是在低成本硬件(如SO-100)上采集的数据存在噪声大、视角受限等问题。构建过程中,研究者需克服单任务下轨迹多样性与数据规模之间的平衡——仅20个演示片段难以覆盖复杂操作中的全部状态变体;同时,6维动作空间(含夹爪控制)需要精确的时间对齐与校准,而双摄像头在遮挡与光照变化下的鲁棒性仍是未解挑战。如何从有限演示中提炼出可迁移的策略,同时保证实时控制的稳定性,仍是该领域的核心瓶颈。
常用场景
经典使用场景
在机器人学习与模仿学习的交叉领域,eval_smolvla-so101-4tasks-aug_sort_25数据集为视觉-语言-动作(VLA)模型的零样本泛化能力评估提供了关键支撑。该数据集依托SO-100系列机器人平台,采集了包含双视角视觉观测(480×640分辨率)、6维关节空间状态与对应动作序列的精密轨迹数据。经典用法在于构建从高维视觉输入到低维运动控制的端到端映射模型,研究者可通过其标准化协议,验证模型在未曾训练的操作环境或目标物体上的迁移表现,从而量化算法在开放世界中的鲁棒性与适应性。
解决学术问题
该数据集直指机器人领域长期存在的‘数据稀缺与任务泛化’悖论。通过提供20个完整演示片段、超过6万帧的高频(30fps)交互数据,它使得研究者得以系统研究模仿学习中的‘因果混淆’问题——即模型可能错误关联视觉特征与动作执行之间的虚假相关性。更重要的是,其精心设计的‘排序增强’策略(aug_sort)为理解视觉语言指令中的顺序逻辑与动作规划的一致性提供了实验范式,推动了解耦表示学习与闭环策略迁移的理论进展。
实际应用
在工业精密装配与家庭服务机器人落地场景中,该数据集展现了独特价值。其含有的‘双指夹爪+6自由度机械臂’运动模式,可直接迁移至常见的协作机器人平台,用于训练分拣、穿插等精细操作技能。实际部署时,模型可利用双摄像头数据(主视与侧视)构建三维空间理解,结合‘动作块(Action Chunk)’技术实现毫秒级决策,显著降低了对实时感知系统的依赖,尤其适应于仓库物流的类人操作任务。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操作技能的模仿学习与视觉运动策略研究,特别是针对SO-100系列机械臂在多种任务下的闭环控制与行为克隆。结合LeRobot框架,数据集通过双摄像头视觉输入与6维关节状态记录,为训练基于视觉的条件策略提供了高保真度的演示数据。当前前沿方向集中于利用大规模离线数据集预训练视觉-语言-动作多模态模型,并基于此类数据微调实现零样本或小样本的机器人操作泛化,其中数据增强与排序策略(如aug_sort_25)被用于提升策略对新任务与扰动的鲁棒性。该数据集在具身智能与机器人基础模型的研究热潮中,为验证视觉运动策略的可扩展性与迁移能力提供了关键评估基准,推动了从固定环境向开放世界操作任务的能力跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务