遇见数据集

bento_ur7e_v1

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

该数据集是使用 LeRobot 机器人框架创建的,基于 UR7e 机器人。数据集包含 204 个 episode,共 364,128 帧,用于单一机器人操作任务。数据集的每个样本包含:7 维动作向量(6 个关节位置和夹爪位置)、7 维观察状态向量(同样为关节和夹爪位置)、来自顶部摄像头(分辨率 480x640,AV1 编码,60fps)和腕部摄像头(相同规格)的 RGB 视频帧、时间戳、帧索引、episode 索引、任务索引等元数据。数据以 parquet 文件存储结构化数据,视频以 mp4 格式存储。可应用于机器人模仿学习、动作预测、视觉运动策略等任务。按照 Apache-2.0 许可发布。

This dataset is created using the LeRobot robot framework, based on the UR7e robot. It contains 204 episodes with a total of 364,128 frames for a single robot manipulation task. Each sample in the dataset includes: a 7-dimensional action vector (6 joint positions and gripper position), a 7-dimensional observation state vector (also joint and gripper positions), RGB video frames from a top camera (resolution 480x640, AV1 encoding, 60fps) and a wrist camera (same specifications), as well as metadata such as timestamps, frame indices, episode indices, and task indices. Structured data is stored in parquet files, and videos are stored in mp4 format. It can be applied to tasks such as robot imitation learning, action prediction, and visual motor policies. Released under the Apache-2.0 license.

创建时间:
2026-09-08
原始信息汇总

数据集概述

基本信息

  • 数据集名称:bento_ur7e_v1
  • 数据集地址:https://huggingface.co/datasets/polarisai-robots/bento_ur7e_v1
  • 许可证:apache-2.0
  • 任务类别:robotics
  • 标签:LeRobot
  • 创建工具:LeRobot(https://github.com/huggingface/lerobot)

数据集描述

  • 主页:More Information Needed
  • 论文:More Information Needed
  • 许可证:apache-2.0

数据集结构

配置信息

  • 配置名称:default
  • 数据文件:data//.parquet

元数据信息(meta/info.json)

  • 代码库版本:v3.0
  • 帧率:60 fps
  • 机器人类型:ur7e
  • 总回合数:204
  • 总帧数:364128
  • 总任务数:1
  • 分块大小:1000
  • 数据文件大小:100 MB
  • 视频文件大小:200 MB
  • 数据路径:data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径:videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 数据划分:train: 0:204

特征信息

action

  • 数据类型:float32
  • 形状:[7]
  • 名称:joint_0.pos, joint_1.pos, joint_2.pos, joint_3.pos, joint_4.pos, joint_5.pos, gripper.pos

observation.state

  • 数据类型:float32
  • 形状:[7]
  • 名称:joint_0.pos, joint_1.pos, joint_2.pos, joint_3.pos, joint_4.pos, joint_5.pos, gripper.pos

observation.images.top

  • 数据类型:video
  • 形状:[480, 640, 3]
  • 名称:height, width, channels
  • 视频信息
    • 是否为深度图:否
    • 高度:480
    • 宽度:640
    • 编解码器:av1
    • 像素格式:yuv420p
    • 帧率:60
    • 通道数:3
    • 是否包含音频:否
    • 视频g参数:2
    • 视频crf:30
    • 视频preset:12
    • 快速解码:0
    • 视频后端:pyav
    • 额外选项:{}

observation.images.wrist

  • 数据类型:video
  • 形状:[480, 640, 3]
  • 名称:height, width, channels
  • 视频信息
    • 是否为深度图:否
    • 高度:480
    • 宽度:640
    • 编解码器:av1
    • 像素格式:yuv420p
    • 帧率:60
    • 通道数:3
    • 是否包含音频:否
    • 视频g参数:2
    • 视频crf:30
    • 视频preset:12
    • 快速解码:0
    • 视频后端:pyav
    • 额外选项:{}

timestamp

  • 数据类型:float32
  • 形状:[1]
  • 名称:null

frame_index

  • 数据类型:int64
  • 形状:[1]
  • 名称:null

episode_index

  • 数据类型:int64
  • 形状:[1]
  • 名称:null

index

  • 数据类型:int64
  • 形状:[1]
  • 名称:null

task_index

  • 数据类型:int64
  • 形状:[1]
  • 名称:null

引用

BibTeX

[More Information Needed]

搜集汇总
数据集介绍
bento_ur7e_v1 数据集图片
构建方式
该数据集依托LeRobot框架构建,遵循机器人学习领域标准化的数据采集范式。构建过程以Universal Robots UR7e机械臂为平台,通过遥操作或预设策略执行单一任务,同步记录七自由度关节位置与夹爪状态。数据以60帧每秒的频率采集,涵盖204个完整任务回合,累计364,128帧。原始多模态信号经编码后存储为Parquet格式,动作与状态数据按块组织,视频流采用AV1编码压缩,最终形成结构化、可复现的机器人操作数据集。
特点
数据集的核心特征体现于多模态同步性与高时空分辨率。每条样本包含动作指令与观测状态各七维,分别对应六个关节位置及夹爪开合度,并配以顶部与腕部双视角视频,分辨率达640×480,帧率60Hz。元信息完整记录时间戳、帧索引、回合索引及任务索引,便于时序建模。整体数据规模达364,128帧,划分单一训练集,适用于端到端模仿学习与策略评估。
使用方法
使用该数据集时,可借助LeRobot工具链直接加载Parquet数据文件与对应视频流,通过元信息中的data_path与video_path模板定位各分块资源。研究人员可利用Hugging Face Spaces提供的可视化界面预览数据分布与任务执行过程。在模型训练中,通常将动作序列作为预测目标,关节状态与双视角图像作为输入,按时间步对齐构建监督学习样本,进而开展机器人操作策略的学习与泛化验证。
背景与挑战
背景概述
机器人学习领域近年来在视觉-语言-动作模型与模仿学习的推动下迅猛发展,高质量、标准化且易于复现的操作数据集成为衡量算法泛化能力的关键基础设施。bento_ur7e_v1数据集由Polaris AI团队依托Hugging Face LeRobot框架构建,于2025年前后发布,基于UR7E机械臂采集204条任务演示轨迹,累计364128帧,同步记录60Hz关节位置、夹爪状态及顶部与腕部双视角视频流,采用Apache-2.0许可开放共享。该数据集聚焦真实机器人操作任务,为模仿学习、视频预测及多模态策略学习提供了细粒度时序对齐的基准资源,对推动可复现机器人研究具有积极意义。
当前挑战
该数据集所应对的领域核心挑战在于真实机器人操作中高维连续动作空间与视觉观测之间的语义鸿沟,以及有限演示样本下的泛化难题。构建过程中,研究团队面临多模态数据严格时间同步、60Hz高频视频编码与存储开销的平衡、双视角摄像机标定与遮挡处理、机械臂关节轨迹与夹爪动作的精确对齐等工程难题。与此同时,204条演示轨迹仅覆盖单一任务,任务多样性不足可能限制策略迁移能力,视频压缩参数与帧率设置对下游模仿学习性能的潜在影响亦有待系统评估,这些因素共同构成数据集应用与扩展时需审慎对待的现实挑战。
常用场景
经典使用场景
在机器人学习与具身智能领域,bento_ur7e_v1数据集凭借其高频率的60帧每秒采样与多视角视觉观测,构成了模仿学习与视觉-动作策略研究的经典实验平台。研究者通常将204个成功演示片段作为监督信号,训练端到端的神经网络,使UR7E机械臂能够在连续动作空间中复现精细操作。该数据集尤其适用于模仿学习、行为克隆及基于视觉的强化学习等场景,为算法提供从原始像素到关节位姿映射的完整训练素材。
衍生相关工作
基于bento_ur7e_v1,研究者相继开发了面向UR系列机械臂的模仿学习流程优化方法、多视角视觉编码器架构以及LeRobot生态下的策略评估工具。部分工作进一步将其扩展至跨具身迁移与多任务学习,验证了数据格式标准化对下游任务泛化的促进作用,并推动了开源机器人学习社区的协作与迭代。
数据集最近研究
最新研究方向
在机器人学习领域,基于LeRobot框架构建的bento_ur7e_v1数据集正推动着视觉-动作联合建模的前沿探索。该数据集以60Hz高频采集UR7E机械臂的七维关节位置与夹爪状态,并同步记录顶部和腕部双视角视频,为模仿学习与端到端策略学习提供了丰富的多模态时序信号。当前研究热点聚焦于利用此类高帧率、多视角数据提升长时程任务的操作泛化能力,尤其是在精细装配与动态抓取场景中,双视角的互补性有助于缓解遮挡与深度歧义问题。该数据集支持训练具备空间感知与动作预测能力的扩散策略或Transformer架构,对推动通用机器人操作基座模型的发展具有重要价值,并为社区建立可复现的基准评测提供了关键资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务