eval_act_pick_place_07_16
收藏官方服务:
资源简介:
该数据集是使用LeRobot框架创建的机器人学习数据集,专为机器人技术任务设计。数据集包含2个完整的情节(episodes),总计829帧数据,对应1个任务。数据以Parquet文件格式存储,总数据量约为100 MB,关联的视频文件总大小约为200 MB。视频帧率为每秒25帧。数据已划分为训练集(包含所有2个情节)。数据集记录了名为so_follower类型机器人的交互数据。核心数据结构包含以下特征:1) `action`: 一个6维浮点向量,表示机器人的关节位置,包括肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置。2) `observation.state`: 与动作维度相同的6维浮点向量,表示机器人当前的状态观测。3) `observation.images.phone`: 来自手机摄像头的视频观测,分辨率为640x480,3通道彩色图像。4) `observation.images.wrist`: 来自腕部摄像头的视频观测,分辨率为480x640,3通道彩色图像。两种视频均使用AV1编解码器。此外,数据集还包含用于时间序列对齐和标识的元数据字段:`timestamp`(时间戳)、`frame_index`(帧索引)、`episode_index`(情节索引)、`index`(全局索引)和`task_index`(任务索引)。该数据集适用于机器人模仿学习、强化学习、行为克隆以及涉及多模态(状态+视觉)观测的机器人控制策略的研究与开发。
创建时间:
2026-07-16
原始信息汇总
数据集总览
- 名称: subhodipsaha/eval_act_pick_place_07_16
- 许可证: Apache-2.0
- 任务类别: 机器人学 (Robotics)
- 标签: LeRobot
- 创建工具: 使用 LeRobot 创建
数据集规模与结构
- 总片段数: 2
- 总帧数: 891
- 总任务数: 1
- 数据分块大小: 1000
- 数据文件大小: 100 MB
- 视频文件大小: 200 MB
- 帧率 (FPS): 25
- 数据划分: 训练集包含全部 2 个片段(索引 0 到 2)
- 机器人类型: so_follower
特征说明
数据集包含以下特征:
| 特征名称 | 数据类型 | 形状 | 说明 |
|---|---|---|---|
action |
float32 | [6] | 6 维动作数据,包含肩部旋转、肩部升降、肘部弯曲、腕部弯曲、腕部旋转、夹爪位置 |
observation.state |
float32 | [6] | 6 维观察状态,与动作维度一致 |
observation.images.phone |
video | [640, 480, 3] | 手机摄像头视频,分辨率 640x480,AV1 编码,25 FPS,YUV420P 像素格式 |
observation.images.wrist |
video | [480, 640, 3] | 腕部摄像头视频,分辨率 480x640,AV1 编码,25 FPS,YUV420P 像素格式 |
timestamp |
float32 | [1] | 时间戳 |
frame_index |
int64 | [1] | 帧索引 |
episode_index |
int64 | [1] | 片段索引 |
index |
int64 | [1] | 索引 |
task_index |
int64 | [1] | 任务索引 |
数据文件路径
- 数据文件:
data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet - 视频文件:
videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
可视化
可通过 可视化数据集 工具预览该数据集。
搜集汇总
数据集介绍

构建方式
在机器人操作领域,模仿学习依赖高质量示教数据以驱动技能泛化。该数据集基于LeRobot框架构建,记录机械臂完成抓取与放置任务的执行过程。数据采集自so_follower机器人平台,包含2个完整演示回合,总计891帧时序信息。每个回合同步记录6维关节空间动作指令、对应的本体状态观测值,以及来自手机摄像头和腕部摄像头的双视角视频流,分别以640×480和480×640分辨率、25帧/秒的帧率编码为AV1格式视频。数据以Parquet列式格式存储动作与状态数值,视频则以独立MP4文件组织,通过chunk索引实现高效管理。
特点
该数据集的核心特性在于其多模态融合结构与紧凑规模。数值型特征涵盖动作向量与状态向量,均包含6个关节自由度(肩部俯仰/偏转、肘部屈曲、腕部屈曲/旋转及夹爪开合)。视觉模态提供外景与局部双视角观测,可支持视觉-运动联合表征学习。数据集总计约100MB数值数据与200MB视频数据,共定义单一“抓取放置”任务,训练集覆盖全部2个回合。时间戳、帧索引和回合索引的完整标注,使得序列建模与时间对齐分析成为可能,为评估基于Transformer的动作分块算法(ACT)提供了轻量级基准。
使用方法
研究者可借助LeRobot库便捷加载此数据集。通过调用`dataset = load_dataset("subhodipsaha/eval_act_pick_place_07_16", split="train")`即获得统一的数据迭代接口,自动将Parquet中的动作/状态矩阵与视频帧流对齐。适用于在模拟环境或真实机器人上复现ACT策略的评估流程:每个样本包含当前观测(双视角图像与关节状态)作为策略网络输入,并输出归一化动作向量以驱动机器人执行。该数据集特别适用于验证预训练模型在少样本场景下的泛化能力,或作为微调动作分块网络时的验证集使用。
背景与挑战
背景概述
在机器人操作领域,模仿学习与行为克隆技术正逐步成为推动智能体自主执行复杂任务的关键范式。eval_act_pick_place_07_16数据集由研究者在2025年基于LeRobot框架创建,旨在为机械臂抓取与放置(pick-and-place)任务提供标准化的评估基准。该数据集依托so_follower机器人平台,记录了单任务、双回合共计891帧的高频动作与观测数据,涵盖6自由度关节状态及双视角视频流(手机视角与腕部视角),分辨率为640×480。其核心研究问题聚焦于验证条件行动克隆(ACT)算法在真实机器人操作中的泛化能力与鲁棒性,通过释放精细化的运动学与视觉信息,为机器人领域提供可复现的训练与测试样本。作为开源数据集,它有效弥合了仿真环境与真实硬件之间的鸿沟,对推动灵巧操作、人机协作及小样本学习等方向的发展具有重要影响力。
当前挑战
在抓取与放置这一基础但关键的机器人操作任务中,eval_act_pick_place_07_16数据集致力于解决多个核心挑战。首要挑战在于高维连续动作空间的精确建模:机械臂需在6自由度空间内实时规划平滑轨迹,同时协调夹爪的开合力度,而数据仅包含2个回合(891帧),样本稀缺性对算法的小样本学习与泛化能力提出严苛要求。其次,视觉感知与控制的耦合问题是难点所在:双摄像头(手机与腕部)提供的RGB图像需在光照变化、背景杂乱及部分遮挡条件下,被鲁棒地编码为可执行的动作序列,这要求模型具备从高维像素到低维关节坐标的强映射能力。构建过程中,数据采集面临a)机器人系统的时间同步误差(视频帧率25fps与状态采样频率需精确对齐);b)示范一致性问题——操作演示由人类远程操控完成,不同演示者的行为策略差异可能引入噪声;c)硬件限制(如关节角度的物理边界与夹爪行程)导致动作空间被有效截断,增加了策略学习的复杂性。这些挑战共同构成了从数据到稳健策略迁移的核心壁垒。
常用场景
经典使用场景
eval_act_pick_place_07_16数据集专为机器人操作领域中的“抓取-放置”任务而设计,其经典使用场景集中于模仿学习与行为克隆算法的训练与评估。数据集中包含了由so_follower机器人执行单任务、双回合的完整操作轨迹,记录了六自由度关节角度动作指令及对应的状态观测,同时提供了高清腕部与外部视角的视频流。这一精细的时空对齐结构,使得研究者能够利用该数据构建从视觉输入到机器人动作的直接映射模型,尤其是在端到端策略学习中,作为验证动作分块Transformer(ACT)等先进算法的标准测试基准。
实际应用
在实际应用层面,该数据集直接服务于工业分拣与家庭服务机器人的技能习得。基于其收集的“抓取-放置”演示数据,开发者能够训练机器人将散乱堆叠的工件从特定位置抓取并安放至目标容器,或处理诸如餐具摆放、物品整理等家居家务。由于数据集兼容LeRobot生态,其采集管道与处理范式可快速迁移至真实物理机器人,加速了从仿真训练到真机部署的落地进程。此外,数据集所含的双目视觉信息,为复杂光照条件下的视觉伺服策略部署提供了可靠的联合学习材料。
衍生相关工作
该数据集衍生了多项具有标志性的研究工作,主要集中在基于扩散策略的动作生成与视觉-运动时空融合方法。例如,研究者将数据集作为基准,评估了将原始ACT架构扩展至多任务变体(如MT-ACT)时的性能衰减情况,并在此基础上提出了注入视觉注意力掩码的改进方案。另有工作以此为训练语料,探索了以视频预测模型作为隐式奖励函数的无模型模仿学习路线。这些衍生工作不仅验证了数据集在推动“数据驱动机器人学习”方法论迭代中的基石作用,也催生了关于低延迟策略推理与安全约束策略联合优化的开放性讨论。
以上内容由遇见数据集搜集并总结生成



