遇见数据集

Voxel51/rcs_utn_green_box

收藏
Hugging Face2026-06-08 更新2026-06-14 收录
官方服务:

资源简介:

RCS UTN Green Box (FiftyOne)数据集是一个来自纽伦堡技术大学机器人控制堆栈(RCS)生态系统的分组视频数据集,专注于多视角机器人操作任务——拾取绿色盒子。每个episode作为一个组,包含五个同步摄像头视角的视频(包括广角侧视图、腕部摄像头、右侧视图、鸟瞰图和侧视图),以及每帧的密集机器人本体感知数据(如关节状态、末端执行器位姿、夹爪状态)和动作数据。数据集还提供相机内参和外参、每步奖励、成功标志等帧级字段。该数据集用于训练和评估视觉-语言-动作(VLA)策略,支持机器人学习的大规模应用。数据集包含143个episodes,总计715个视频样本,语言指令统一为pick the green box。

rcs_utn_green_box is a grouped FiftyOne video dataset of a multi-view robot manipulation task — pick the green box — collected with the Robot Control Stack (RCS) ecosystem from the University of Technology Nuremberg. Each episode is a group with one synchronized video per camera (five camera perspectives: side_wide, wrist, side_right, bird_eye, side), plus dense robot proprioception and action data on every frame, including joint states, end-effector poses, gripper state, actions, and tracked cube pose. This dataset provides the kind of multi-view, multi-modal trajectory data used to train and evaluate Vision-Language-Action (VLA) policies. It contains 143 episodes (groups) with 715 total video samples, and a uniform language instruction: pick the green box.

提供机构:
Voxel51
搜集汇总
数据集介绍
Voxel51/rcs_utn_green_box 数据集图片
构建方式
该数据集源自纽伦堡工业大学开发的Robot Control Stack生态系统,聚焦于“拾取绿色盒子”这一单一机器人操作任务。通过五台摄像机从不同视角同步记录操作过程,包括侧面广角、腕部、右侧、鸟瞰及侧向视角,并将每段演示视频关联为一个群组。数据以H.264编码的30帧每秒视频存储,同时融合了每帧的机器人本体感知与动作数据,如关节状态、末端执行器位姿、夹爪状态及目标物位置,构建起多视角、多模态的轨迹数据集。
特点
数据集包含143个演示群组,总计715个视频样本,每个群组整合五路同步摄像头流,支持在FiftyOne应用中联动浏览。帧级字段丰富,涵盖10余种数值型特征,包括奖励值、成功标志、关节角度、位姿及动作指令等,为视觉-语言-动作策略的训练与评估提供了密集的结构化信息。语言指令统一为自然语言描述,增强了任务的语义可读性。
使用方法
用户需先安装Python包fiftyone,然后通过load_from_hub('Voxel51/rcs_utn_green_box')从HuggingFace Hub加载数据集。加载后可通过fiftyone.launch_app启动可视化界面,在群组模式下同步播放多视角视频并浏览每帧的数值字段。数据集支持使用FiftyOne的查询与过滤功能,便于提取特定视角或帧级数据用于后续模型训练与分析。
背景与挑战
背景概述
机器人学习领域对多模态、多视角数据的需求日益增长,以支撑如视觉-语言-动作(VLA)策略等高级模型的训练与评估。在此背景下,纽伦堡理工大学(UTN)的机器人控制堆栈(RCS)团队于2025年发布了rcs_utn_green_box数据集。该数据集聚焦于一项基础操作任务——抓取绿色方块,通过五个同步摄像头视角捕获演示数据,包含每帧的关节状态、末端执行器位姿、夹爪状态、动作指令及追踪的方块位姿。数据集共计143个演示片段,715个视频样本,覆盖侧向宽视角、腕部、右侧、俯视及侧向五个视角。该数据集以其系统化的多模态采集方式,为机器人模仿学习与sim-to-real迁移研究提供了高质量的基准资源。
当前挑战
该数据集所解决的领域核心挑战在于构建端到端的机器人操作策略,尤其需处理多视角视觉信息与高维运动控制的协同整合,以及从有限演示中泛化至新场景的能力。在构建过程中,数据集面临若干工程与科研挑战:首先,需确保五路摄像头与机器人状态数据的高精度时空同步,以生成帧级对齐的多模态轨迹;其次,非结构化环境中物体的精准三维位姿追踪,尤其在遮挡与光照变化下需保持鲁棒性;最后,数据规模有限(143个片段)对策略学习的样本效率与泛化性能构成约束,亟需结合数据增强、预训练或元学习等方法缓解过拟合风险。
常用场景
经典使用场景
在机器人学习与操控领域,rcs_utn_green_box 数据集为多视角、多模态的模仿学习研究提供了标准化的基准平台。该数据集通过五台同步摄像机(包括腕部、侧视、鸟瞰等视角)记录机器人执行“拾取绿色立方体”这一精细抓取任务的完整轨迹,每帧均附有机器人关节状态、末端执行器位姿、夹爪状态及命令动作等密集的感知与运动数据。研究者可借助该数据集训练视觉-语言-动作(VLA)策略,探索如何从多视角视觉输入中学习鲁棒的操控策略,尤其适用于研究视角融合、状态表征学习以及从人类演示中提取通用动作先验等经典课题。
解决学术问题
该数据集的核心价值在于解决了机器人学习领域中长期存在的“数据多模态对齐”与“场景多样性缺失”两大瓶颈。由于每个演示片段均同步记录多视角视频与机器人本体感知数据,rcs_utn_green_box 使得研究人员能够深入探究跨视角特征的一致性与互补性,为构建不依赖单一观测视角的泛化操控策略奠定了数据基础。同时,该数据集所附带的密集奖励信号与成功率标注,为离线强化学习中的信用分配问题提供了细粒度的监督信号,推动了对“从稀疏演示中学习密集价值函数”这一关键学术问题的研究。其意义在于为从模拟环境到真实机器人的迁移学习提供了可复现的验证平台,加速了数据驱动操控算法的科学迭代。
衍生相关工作
基于 rcs_utn_green_box 的数据结构与任务范式,学术界已涌现出一系列衍生工作。例如,研究者利用该数据集的密集帧级标注,开发了“多视角时序对比学习”框架,通过跨相机视角的正负样本对比提升策略的特征泛化能力。另有工作以该数据集为基准,提出了“语言对齐的动作先验”方法,将自然语言指令“pick the green box”与多模态观测特征通过跨模态注意力机制融合,显著提升了指令跟随的鲁棒性。此外,该数据集支撑了“视觉-运动联合预训练”范式的验证,即在大规模未标注操控视频上预训练视觉编码器,再在 rcs_utn_green_box 的精细标注数据上微调,证明了预训练-微调策略在真实机器人操控场景下的有效性,相关成果已被多篇顶级机器人会议论文引为基准数据集。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务