遇见数据集

vitra-instructions-qwen35-122b-egocentric-v1

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

VITRA Egocentric Instructions Sidecars 是一个由 Qwen3.5-122B 模型从 VITRA 附录 A.1 第一轮提示生成的候选手部动作指令数据集,第二轮生成五个保持原意的祈使句改写。该数据集以 sidecar 形式发布,不修改或替换原始 VITRA 片段。每条记录包含源仓库/修订版、注释和视频路径、手部、半开帧范围、时间范围、边界方法、模型、提示版本、解析状态以及原始弱/官方指令。数据来源包括 OakInk2、HOT3D、HOI4D 和 GigaHands 数据集(DexYCB 因缺乏第一人称视图被排除)。管道流程:使用官方区间或 VITRA 风格手腕速度局部最小值划分片段;均匀采样 8 帧;投影未来 3D 手掌轨迹;VLM 生成一个祈使句手部动作或 N/A;对接受的动作为生成五个改写。数据集适用于机器人 VLA 任务和第一人称视频理解,提供可审计的生成结果。

VITRA Egocentric Instructions Sidecars is a dataset of candidate hand action instructions generated by the Qwen3.5-122B model from the first round of prompts in VITRA Appendix A.1, with a second round generating five imperative rewrites that preserve the original meaning. The dataset is released in sidecar format, without modifying or replacing the original VITRA clips. Each record contains source repository/revision, annotations and video paths, hand, semi-open frame range, temporal range, boundary method, model, prompt version, parsing status, and original weak/official instruction. Data sources include OakInk2, HOT3D, HOI4D, and GigaHands datasets (DexYCB is excluded due to lack of first-person view). Pipeline: segment clips using official intervals or VITRA-style wrist velocity local minima; uniformly sample 8 frames; project future 3D palm trajectories; VLM generates an imperative hand action or N/A; for accepted actions, generate five rewrites. The dataset is suitable for robot VLA tasks and first-person video understanding, providing auditable generation results.

创建时间:
2026-08-16
原始信息汇总

数据集概述

数据集名称:VITRA Egocentric Instructions (Qwen3.5-122B)
数据集类型:侧车数据集(Sidecar Dataset)
任务类别:机器人学、视频分类
标签:VLA、第一视角视频、手-物交互、Qwen3.5、VITRA

核心内容

该数据集包含由 Qwen/Qwen3.5-122B-A10B-FP8 模型生成的候选手部动作指令,基于 VITRA 附录 A.1 首轮提示词生成。第二轮通过 VLA-HAND 的 episode_cutting 流程生成五个保持语义的命令式改写版本。

作为侧车数据集,它不修改或替换原始 VITRA 片段。每一行记录包含:

  • 精确的源仓库/修订版本
  • 标注和视频路径
  • 手部标识、半开帧范围、时间范围
  • 边界方法、模型、提示词版本、解析状态
  • 原始弱/官方指令

视图策略

每个物理片段仅使用一个主第一视角/头戴式 RGB 视图:

  • OakInk2:仅使用 egocentric 视图
  • HOT3D:使用主 Quest RGB 1201-1 或 Aria RGB 214-1
  • HOI4D:使用耦合的头戴式 RGB 流
  • GigaHands:严格使用 brics-odroid-001_cam0 映射
  • DexYCB:明确排除(仅有外部固定 RealSense 摄像头,无第一视角流)

生成流程

  1. 优先使用官方 OakInk2 原始时间区间;否则应用 VITRA 风格的平滑三维手腕速度局部最小值(世界坐标系,0.5 秒居中窗口),在活动手部独立计算
  2. 从每个候选片段均匀采样八个时间有序帧
  3. 在每个采样帧上,使用该帧自身的世界到相机外参投影未来三维手掌轨迹;若源视频未校正,则应用相机畸变
  4. 向视觉语言模型请求一个命令式、特定手部的动作或 N/A,并保留简短视觉理由
  5. 对接受的动作,生成五个保持语义的改写版本

accepted=true 的行具有解析出的非 N/A 动作。被拒绝的行保留在发布中以便审计;此生成任务不会破坏性删除任何源片段。

数据来源

  • MIT-Media-Lab/oakink2-vitra-streaming-v1
  • MIT-Media-Lab/hot3d-clips-vitra-streaming-v3
  • MIT-Media-Lab/hoi4d-vitra-streaming-v1
  • LeoJiangOR/gigahands-vitra-mano-strict-v1
  • MIT-Media-Lab/dexycb-vitra-streaming-v2(仅视图策略排除)

各数据集的进度和最终计数存储于 state/ 目录;生成的 JSONL 分片存储于 data/<dataset>/ 目录,可按确定性片段 ID 安全恢复。

搜集汇总
数据集介绍
vitra-instructions-qwen35-122b-egocentric-v1 数据集图片
构建方式
该数据集依托于VITRA附录A.1的首轮提示,利用Qwen/Qwen3.5-122B-A10B-FP8模型生成候选手部动作指令,并经由VLA-HAND的episode_cutting流水线进行第二轮生成,产出五条保留原意的祈使句改述。构建流程严格遵循视点策略,仅采用物理片段中的主第一视角RGB流,具体规定各源数据集的视点映射。在动作候选切分上,优先采用官方指定间隔,否则依据平滑后的3D腕部速度局部最小值进行动态切分。随后,对每个候选片段均匀采样八帧,并利用各帧的相机外参投影未来手掌轨迹,以辅助视觉语言模型生成指令,同时保留简短视觉推理。最终,接受的动作被扩展为五个同义改述,而拒绝的样本也保留用于审计,确保生成过程的透明性和可追溯性。
使用方法
使用时,用户可直接加载data/<dataset>/路径下的JSONL分片文件,依据每行中的accepted字段筛选有效指令,并结合源数据集提供的对应视频片段和三维轨迹信息,用于训练视觉-语言-动作模型或进行视频指令理解研究。该辅助数据集提供与源VITRA片段的精确映射,故用户需先获取并挂载相应的源数据仓库,然后按行中的路径字段读取原始视频和标注。对于被拒绝的样本,可用作负样本或用于错误分析。此外,由于包含模型、提示版本等信息,用户可追溯每条指令的生成背景,便于进行可控的数据筛选或进一步的条件生成实验。
背景与挑战
背景概述
VITRA Egocentric Instructions (Qwen3.5-122B) 数据集由MIT媒体实验室等机构于近期创建,旨在解决具身智能中机器人视觉-语言-动作(VLA)模型训练数据匮乏的问题。该数据集作为附属数据(sidecar dataset),为五个第一人称视角(egocentric)手物交互数据集(OakInk2、HOT3D、HOI4D、GigaHands,DexYCB仅用于视图策略排除)生成候选手部动作指令,并利用大型语言模型Qwen3.5-122B对原始指令进行五重意义保持的改写,从而提供高质量、多样化的自然语言指令。其核心研究问题在于如何利用视觉语言模型自动生成与视频片段精确对齐的动作描述,以增强VLA模型对细粒度手部交互的理解与泛化能力。该数据集在机器人学习、多模态理解领域具有潜在影响力,为后续基于第一人称视频的具身智能研究提供了可复用的指令生成流程与训练资源。
当前挑战
该数据集面临的挑战涵盖多层面。在领域问题层面,核心挑战在于从第一人称视频中准确识别手物交互动作并生成实时、具体且与视觉上下文相符的指令,这要求模型能够融合空间、时间与手部姿态信息,同时应对相机运动、遮挡和光照变化。在构建过程中,挑战包括:1) 多数据源异构性,需统一不同数据集(如OakInk2的深度摄像头与HOT3D的AR设备)的视觉流、标注格式和时间同步;2) 动作片段切分的精确性,需基于手部运动速度的局部最小值确定候选段,但不同数据集的质量差异可能导致边界不准确;3) 视角策略限制,排除DexYCB因缺乏第一人称视图,而其他数据集需严格映射特定摄像头,限制了数据量;4) 生成质量与可审计性平衡,需保留被拒绝的样本以供审查,同时避免源数据被破坏性修改,确保数据集的可追溯性和可靠性。
常用场景
经典使用场景
VITRA Egocentric Instructions数据集为机器人操作与具身智能领域提供了精细的第一视角手-物交互指令注释。其经典使用场景在于训练视觉-语言-动作(VLA)模型,通过将自然语言指令与第一人称视角视频中的手部动作序列对齐,增强模型对非结构化环境中物体操纵、工具使用等任务的语义理解与执行能力。该数据集依托OakInk2、HOT3D、HOI4D等大规模基准,涵盖多样化的交互情境,为跨场景泛化的机器人策略学习提供了高质量的训练语料。
解决学术问题
该数据集有效解决了具身智能研究中指令生成与动作分割的标注瓶颈问题,通过自动化流水线生成具有一致语义的指令变体,并精确标注了时间边界与手部活跃性,为无监督或弱监督学习提供可靠的伪标签。其存在也促进了关于多视角视频理解、长时程动作预测以及语言-动作对齐等核心学术问题的探索,推动了机器人从感知到执行的可解释性研究。
实际应用
在实际应用层面,该数据集可服务于家庭服务机器人、工业辅助机械臂等系统的开发,使其能够依据用户的即时语言指令,在复杂的第一人称视觉场景中完成物体拾取、工具操作等具体动作。同时,也可用于增强现实(AR)辅助系统,通过实时理解用户的手部交互意图,提供交互式指导反馈,提升人机协作的效率与安全性。
数据集最近研究
最新研究方向
该数据集聚焦于具身智能与机器人操作领域的前沿研究,特别是利用大规模视觉语言模型(如Qwen3.5-122B)从第一人称视频中生成精细的操作指令,以增强视觉-语言-动作(VLA)模型的训练。其创新之处在于构建了多源异构的手-物交互数据侧车(sidecar),覆盖OakInk2、HOT3D、HOI4D、GigaHands等主流基准,并通过统一的时间分割与投影策略提取未来手掌轨迹,生成带语义保留的指令改写。这一工作推动了从被动视频理解到主动操作生成的范式转变,对机器人仿人操作、人机协同以及具身智能体的泛化能力具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务