遇见数据集

eval_xvla-so101-4tasks-aug_sort_25

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是一个机器人控制数据集,使用LeRobot工具创建。它包含来自so_follower类型机器人的演示数据,适用于机器人模仿学习或强化学习任务。数据集规模为19个完整episodes,共计57,809帧数据,对应1个任务。数据以分块Parquet文件存储,并包含关联的MP4格式视频文件。数据特征包括:机器人的6维动作指令(对应肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置);观测状态(与动作相同的6维关节位置);两个图像观测(image和image2),均为RGB视频,分辨率480x640,帧率30fps;以及时间戳、帧索引、episode索引、全局索引和任务索引等元数据。视频采用AV1编码。数据集遵循Apache-2.0许可证。

This dataset is a robot control dataset created using the LeRobot tool. It contains demonstration data from so_follower type robots, suitable for robot imitation learning or reinforcement learning tasks. The dataset consists of 19 complete episodes, totaling 57,809 frames of data, corresponding to 1 task. Data is stored in chunked Parquet files and includes associated video files in MP4 format. Features include: 6-dimensional action commands for the robot (corresponding to shoulder translation, shoulder elevation, elbow flexion, wrist flexion, wrist rotation, and gripper position); observation states (6-dimensional joint positions identical to the actions); two image observations (image and image2), both RGB videos with a resolution of 480x640 and a frame rate of 30 fps; and metadata such as timestamps, frame index, episode index, global index, and task index. Videos are encoded with AV1. The dataset is licensed under Apache-2.0.

创建时间:
2026-07-20
原始信息汇总

数据集概览

  • 数据集名称: eval_xvla-so101-4tasks-aug_sort_25
  • 许可证: Apache-2.0
  • 任务类别: 机器人技术 (Robotics)
  • 标签: LeRobot

数据集结构

  • 机器人类型: so_follower
  • 总片段数: 20
  • 总帧数: 61173
  • 总任务数: 1
  • 块大小: 1000
  • 数据文件大小: 100 MB
  • 视频文件大小: 200 MB
  • 帧率: 30 FPS
  • 数据划分:
    • 训练集: 片段 0 至 19 (共20个片段)

数据特征

特征 数据类型 形状 说明
action float32 [6] 包含6个关节动作:shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos
observation.state float32 [6] 包含6个关节状态,字段同 action
observation.images.image video [480, 640, 3] 主摄像头视频,AV1编码,30 FPS,高度480像素,宽度640像素,3通道
observation.images.image2 video [480, 640, 3] 另一视角摄像头视频,参数与 image 一致
timestamp float32 [1] 时间戳
frame_index int64 [1] 帧索引
episode_index int64 [1] 片段索引
index int64 [1] 全局索引
task_index int64 [1] 任务索引

数据文件路径

  • 数据文件: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

在线可视化

  • 可使用 LeRobot 可视化工具:https://huggingface.co/spaces/lerobot/visualize_dataset?path=hjkso1406/eval_xvla-so101-4tasks-aug_sort_25
搜集汇总
数据集介绍
eval_xvla-so101-4tasks-aug_sort_25 数据集图片
构建方式
该数据集依托LeRobot框架构建,专为机器人模仿学习任务设计。数据通过SO-100双臂机器人平台采集,聚焦于排序任务场景,共包含20个演示回合,总计61173个时间步,并以30帧/秒的采样频率记录。构建过程中,数据以Parquet格式存储结构化信息,包括6维关节空间的动作指令与状态观测,同时采用AV1编码的视频文件保存双视角视觉观测(图像分辨率480×640),实现了多模态数据的协同归档。数据集按照训练集与原始采集数据全量对齐的原则划分,仅含单一训练集分割。
使用方法
使用该数据集时,推荐采用LeRobot库中的标准数据加载接口。研究人员可通过配置相应的data_files路径,利用LeRobot的Dataset类以迭代器形式高效读取Parquet文件中的数值特征与MP4视频流。在模型训练中,可将action字段作为监督信号,observation.state与observation.images作为输入,构建从感知到动作的映射模型。数据集提供了可视化在线预览功能,允许用户无需下载即可初步浏览样本质量与任务内容,从而快速评估数据与自身研究需求的契合度。
背景与挑战
背景概述
随着机器人学习领域的蓬勃发展,如何高效地收集和利用示范数据以训练机器人的复杂操作技能,已成为核心研究问题之一。在此背景下,由研究人员基于LeRobot框架创建的eval_xvla-so101-4tasks-aug_sort_25数据集应运而生,旨在为机器人灵巧操作任务提供标准化、结构化的训练与评估资源。该数据集记录了20个完整轨迹,包含超过6万帧、30帧每秒的高频视觉与关节状态信息,覆盖单个排序任务的执行过程。其发布不仅填补了开源机器人数据在精细操作场景下的部分空白,也为后续研究提供了可复现的基准,尤其在视觉-语言-动作联合建模领域具有潜在影响力。
当前挑战
该数据集所面临的核心挑战涵盖领域问题与构建过程两个层面。在领域问题上,机器人精细操作任务(如物体排序)要求模型同时处理高维视觉输入、连续动作空间及长时序依赖关系,而现有方法常面临泛化能力弱、对干扰敏感等问题,亟需高质量数据以驱动算法突破。此外,构建过程中亦存在显著挑战:一方面,仅依靠20条轨迹(总帧数约6万)可能难以覆盖丰富任务变化,存在过拟合风险;另一方面,实际数据采集涉及硬件校准、多模态对齐及人工干预,成本高昂且效率受限,对数据规模和多样性的扩展构成制约。
常用场景
经典使用场景
在机器人学习领域,该数据集专注于模仿学习与行为克隆范式中多视角视觉-动作映射的研究。通过记录SO-100机械臂在4种任务上的20个完整演示回合,以30Hz的频率同步采集两个640×480分辨率视角的视觉流与6维关节空间动作序列,为构建端到端视觉运动策略提供了高质量的轨迹数据。数据集特别强调了动作排序与数据增强技术(如“aug_sort_25”所示),使其成为验证序列建模能力与鲁棒性训练方案的理想基准。
解决学术问题
该数据集的核心价值在于解决了机器人长时域任务中低数据效率与泛化瓶颈的问题。通过引入数据增强与排序策略,它有效缓解了演示数据间分布偏移导致的策略过拟合现象。这一特性使其能够支撑任务序列化学习与多模态融合的学术探索,例如研究视觉状态与动作时序之间的跨模态对齐机制,为提升策略在未知场景中的零样本迁移能力提供了重要实验载体。
实际应用
在实际应用中,该数据集驱动的策略可部署于桌面级协作机器人,实现诸如物品分拣、工具操控等精细操作任务。其多视角视觉记录能力(“image”与“image2”)使机器人能适应光照变化或部分遮挡的现实环境,而标准化数据格式(基于LeRobot与Parquet)则降低了从仿真到实物部署的技术鸿沟,加速了学习型机器人在工业质检、家庭服务等领域的落地进程。
数据集最近研究
最新研究方向
该数据集聚焦于机器人模仿学习与多任务操作的前沿探索,基于LeRobot框架构建,通过so_follower机械臂执行包含6维动作空间(肩、肘、腕及夹爪控制)的任务序列,结合双视角视觉输入(480x640分辨率、AV1编码视频流),为细粒度操作技能迁移提供高保真数据基础。当前研究方向紧密围绕具身智能中的“数据驱动泛化”难题,利用经数据增强和排序策略优化后的训练集,推动视觉-语言-动作联合模型(如XVLA)在空间推理与任务编排上的突破。该数据集的意义在于弥合仿真与真实环境间的鸿沟,加速机器人从单一任务向复杂多步操作范式的演进,为构建通用机器人基础模型提供可复现的标准化评估基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务