遇见数据集

dvla-place7obj-roll-250hz-events-250fps-delta-trim

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

该数据集是一个用于机器人操作仿真的多模态数据集,基于MuJoCo/robosuite仿真环境,由Panda机械臂执行“放置”任务。数据集包含14,083个成功演示,机械臂从桌子上拾取物体并放入容器(碗/盘子/托盘)中,涉及7种物体:5种杂货物品(罐头、苹果、牛油果、土豆、柠檬)和2种圆润纹理物体(网球、棒球)。其中80%的演示以物体滚动(发射速度0.25-1.5 m/s)开始,其余为静态初始状态。演示由脚本化的状态机生成,仅保留成功尝试。数据以LeRobot v2.1格式存储,机器人类型为panda,配备3个RGB相机和3个DVS事件相机,分辨率均为360x480(6个视频流:wrist_cam、side_cam、opst_cam及其对应的事件相机流)。训练通常仅使用opst_cam和wrist_cam。动作空间action为10维,包括末端执行器位置增量、欧拉角的正弦/余弦表示和夹爪控制;观察空间observation.state为9维,包含末端执行器位置和欧拉角的正弦/余弦;observation.environment_state为9维,包含特权物体位姿/速度(训练时丢弃)。action是增量形式,编码为绝对目标减去同一帧的状态,评估时解码为当前状态加上预测增量,并逐帧重锚定。绝对目标采用未来末端执行器重标定(future-EE relabel),即机械臂实际到达的位姿(延迟320ms,80帧)。控制频率250Hz,事件相机数据通过v2e生成,并经过delta-trim预处理(正弦/余弦到增量,前置保持修剪)。数据集总帧数11,561,473,总视频数84,498,总块数15,每个块大小1000。适用于机器人操作中的模仿学习、事件相机数据处理、视觉运动控制等研究。

This dataset is a multimodal dataset for robot manipulation simulation, based on the MuJoCo/robosuite simulation environment, with a Panda robot arm performing a placing task. It contains 14,083 successful demonstrations where the robot picks up objects from a table and places them into containers (bowl/plate/tray), involving 7 objects: 5 grocery items (can, apple, avocado, potato, lemon) and 2 round textured objects (tennis ball, baseball). 80% of demonstrations start with object rolling (launch speed 0.25-1.5 m/s), while the rest are static initial states. Demonstrations are generated by a scripted state machine, retaining only successful attempts. Data is stored in LeRobot v2.1 format, robot type is panda, equipped with 3 RGB cameras and 3 DVS event cameras, all with resolution 360x480 (6 video streams: wrist_cam, side_cam, opst_cam and their corresponding event camera streams). Training typically uses only opst_cam and wrist_cam. The action space is 10-dimensional, including end-effector position deltas, sine/cosine of Euler angles, and gripper control. The observation.state is 9-dimensional, containing end-effector position and sine/cosine of Euler angles. observation.environment_state is 9-dimensional, containing privileged object pose/velocity (discarded during training). Actions are incremental, encoded as absolute target minus state at the same frame, decoded as current state plus predicted increment during evaluation, with per-frame re-anchoring. Absolute targets use future-EE relabel, i.e., the actual pose reached by the robot arm (delayed by 320ms, 80 frames). Control frequency is 250Hz. Event camera data is generated via v2e and preprocessed with delta-trim (sine/cosine to increments, hold-before trimming). The dataset has a total of 11,561,473 frames, 84,498 videos, 15 chunks, each chunk size 1000. Suitable for research on imitation learning in robot manipulation, event camera data processing, and visual motor control.

创建时间:
2026-07-31
原始信息汇总

数据集概述:dvla-place7obj-roll-250hz-events-250fps-delta-trim

数据集简介

该数据集包含 14,083 条成功的演示轨迹,记录了一只 Panda 机械臂从桌子上抓取物体并放入容器(碗/盘子/托盘)的操作过程。数据基于 MuJoCo/robosuite 仿真环境生成,控制频率为 250 Hz,同时包含事件相机和 RGB 相机数据。

任务与物体

  • 任务类型:7 物体放置(place)任务
  • 物体类别
    • 5 种杂货物品(10,083 条轨迹):罐子、苹果、牛油果、土豆、柠檬
    • 2 种圆形纹理物体(4,000 条轨迹):网球、棒球
  • 初始状态:80% 的轨迹以物体滚动开始(发射速度 0.25-1.5 m/s),其余为静止状态
  • 数据来源:由读取特权仿真器状态的脚本化状态机生成,仅保留成功的尝试

数据布局与特征

数据格式:LeRobot v2.1,robot_type: panda

相机配置

6 个摄像头(360x480 分辨率):

  • 3 个 RGB 相机:wrist_camside_camopst_cam
  • 3 个 DVS 事件相机:wrist_cam_eventsside_cam_eventsopst_cam_events
  • 训练通常仅使用 opst_camwrist_cam

特征说明

特征 维度 内容
action 10 末端执行器位置增量(dx, dy, dz)、3 个欧拉角的 sin/cos 值、夹爪状态
observation.state 9 末端执行器位置、3 个欧拉角的 sin/cos 值
observation.environment_state 9 特权物体位姿/速度(训练时不使用)
图像特征 6 个视频流(250 fps,h264 编码)

动作编码

  • 动作为增量形式:绝对目标位置减去当前帧状态
  • 评估时解码为:目标 = 实时状态 + 预测增量,每步重新锚定
  • 绝对目标编码的是未来末端执行器重标注:机械臂在 320 ms(80 帧 @ 250 Hz)后实际到达的位姿

数据集统计

  • 总轨迹数:14,083
  • 总帧数:11,561,473
  • 总任务数:105
  • 总视频数:84,498
  • 数据分块:15 块,每块 1,000 条轨迹
  • 训练/测试划分:全部 14,083 条用于训练

数据预处理

采用 delta-trim 预处理流程:

  1. sincos 转换
  2. 计算增量(delta)
  3. 前导保持裁剪(leading-hold trim)

事件数据使用 v2e 工具生成。

附加信息

  • 许可证:Apache-2.0
  • 主页DynamicVLA GitHub 仓库
  • 相关数据集:此数据集是 dvla-place5obj-roll-250hz-events-250fps-delta-trim(10,083 条)和新增 place2obj 数据集(4,000 条)的并集
搜集汇总
数据集介绍
dvla-place7obj-roll-250hz-events-250fps-delta-trim 数据集图片
构建方式
该数据集基于MuJoCo物理引擎与robosuite仿真平台构建,旨在模拟Panda机械臂执行抓取并放置物体的精细操作任务。数据集整合了两个子集:其一为5种杂货物品(罐、苹果、鳄梨、马铃薯、柠檬)的10,083次演示,其二为两种圆形纹理物体(网球、棒球)的4,000次演示,总计14,083次成功示范。所有演示由读取特权模拟器状态的脚本化状态机生成,仅保留成功尝试。特别地,80%的回合初始时物体会以0.25至1.5 m/s的初速度滚动,其余为静态状态。对于圆形物体,采用了可达范围内生成及工作空间可达门控策略,避免机械臂过度伸展。数据以LeRobot v2.1格式存储,包含3个RGB相机与3个DVS事件相机(分辨率360x480),动作以250 Hz频率记录,事件流经v2e工具生成,并应用了delta-trim预处理(将sincos编码转为增量,并进行前导保持裁剪)。
特点
数据集的核心特征在于其高时间分辨率(250 Hz)与事件相机的融合,提供了动态场景中机器人操作的丰富时序信息。动作空间为10维,包含末端执行器位置、欧拉角的正弦余弦编码及夹爪状态,且动作为增量形式,编码了未来320毫秒(80帧)后机械臂实际到达的位姿,这促进了预测控制策略的学习。观测状态包括9维的关节/末端位姿,以及可丢弃的特权环境状态(物体位姿与速度),便于在真实机器人上部署。数据规模宏大,总帧数超过1,156万,视频片段84,498段,任务数105个,且均匀分为训练集(全部14,083集)无验证集,展现了在多种物体与动态条件下的鲁棒性。
使用方法
数据集可通过LeRobot库加载,使用HuggingFace的datasets模块直接访问。训练时通常选用操作台相机(opst_cam)与腕部相机(wrist_cam)的RGB及事件流。由于动作为增量形式,在评估时需解码为绝对目标:将预测的增量与当前状态相加,并每步重新锚定。特权环境状态在训练中应予以剔除,以模拟真实机器人的观测条件。数据以parquet格式存储,视频以H.264编码,支持使用LeRobot的API进行分批加载与预处理。适用于训练模仿学习或强化学习算法,尤其针对需要高频控制与事件感知的动态抓取放置任务。
背景与挑战
背景概述
该数据集由DynamicVLA项目团队于近期构建,依托于HuggingFace LeRobot框架,旨在推动动态操作场景下的机器人学习研究。数据集包含14,083条成功的Panda机械臂抓取-放置演示,覆盖7种物体(包括罐、苹果、牛油果、土豆、柠檬及两种圆形纹理球体),其中80%的演示起始于物体滚动状态,速度范围0.25-1.5 m/s,模拟了动态物体的实时操作挑战。数据采集采用250 Hz高频率控制,配备3个RGB相机和3个事件相机(事件流经v2e生成),并提供增量动作编码和特权状态信息,为视觉-运动控制策略的训练提供了丰富且高时间分辨率的数据支撑。该数据集是dvla-place5obj-roll数据集的扩展,融合了两种球形物体的动态场景,为研究事件相机在高速动态抓取任务中的应用提供了基准,对机器人操作领域具有潜在影响。
当前挑战
该数据集所解决的领域问题核心在于动态物体操作中的快速感知与控制,传统RGB相机因帧率限制难以捕捉高速运动细节,而事件相机虽能提供高时间分辨率,但其非结构化输出对策略学习构成挑战,且需与常规视觉模态有效融合。构建过程中,研究者面临多重挑战:确保物体滚动初始状态的可控性与多样性,设计状态机以筛选成功演示,避免机械臂过度伸展并确保放置成功率;事件数据的生成需经v2e工具转换,并采用delta-trim预处理以统一动作表示,该过程涉及时序对齐与数据冗余消除;此外,多相机同步、高帧率数据存储与处理(总帧数超1100万)亦对工程实现提出严苛要求,从仿真到真实机器人迁移的可行性仍待验证。
常用场景
经典使用场景
该数据集专为机器人操作中的动态物体抓取与放置任务设计,核心使用场景为训练和评估视觉运动策略(Visuomotor Policies)在高频控制下的鲁棒性。数据包含250Hz的关节控制指令、三视角RGB图像与对应的事件相机流,特别针对物体滚动(速度0.25-1.5 m/s)的挑战性场景,用于研究多模态感知融合、时序差分建模以及高频动作预测。研究者可利用其14,083条成功演示,在仿真环境(MuJoCo/robosuite)中开发模仿学习或强化学习算法,通过对比事件相机与RGB相机的性能差异,探索事件驱动视觉在快速运动捕捉中的优势。
解决学术问题
该数据集解决了动态场景下机器人操作的两个核心学术难题:一是高频控制与视觉感知的时序对齐问题,通过提供250Hz的同步事件流与RGB帧,支持研究视觉延迟补偿和事件相机的时间分辨率优势;二是动态物体的稳定抓取问题,通过引入物体滚动和多种形状(如球体、农产品),打破了传统静态物体抓取数据集的局限,促进了对运动预测、接触动力学和实时反馈策略的研究。其'delta-trim'预处理和未来末端执行器重标记(320ms前瞻)为学习因果动作表征提供了新范式,推动了样本效率和高频决策的研究。
衍生相关工作
该数据集衍生的工作集中于动态视觉运动控制、事件相机与RGB融合的表示学习,以及高频模仿学习算法的改进。代表性方向包括:基于事件流的目标检测与运动预测模型(如利用事件相机的异步特性估计物体轨迹)、用于高频动作生成的扩散策略或变换器架构,以及解决Sim2Real差距的域随机化技术。此外,'delta-trim'和未来重标记策略启发了后续关于动作空间预处理和时序一致性损失的研究,促进了LeRobot生态系统中多模态机器人数据集的标准制定。相关成果可应用于视觉伺服、动态抓取和移动操作等前沿课题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务