遇见数据集

longhorizon-subtask-decomposition

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

该数据集用于长视野子任务分解任务。给定一个桌面操作场景的初始帧图像以及一条复合指令,模型需要生成完成该指令所需的一系列有序的单个拾取放置子任务。每个样本对应一个场景。数据集的帧图像和标签来自三个基于 SimplerEnv(WidowX/Bridge)、RobotArena(WidowX)和 RoboLab(Franka)构建的长视野组合基准套件。每个样本的帧图像是评估时编排器实际看到的重置观测图像,具有相同的相机视角、确定性布局和指令字符串。标签是真实标签,来源于每个套件的任务注册表,并经过严格校验,确保子任务序列与计划缓存中的真实计划一致。数据集包含102个场景,其中23个场景的任务需要按顺序执行(ordered),每个场景的目标数量(goals)从1到10不等。任务类型涵盖单一目标、分割目标、转移、接力、重访、排除、有序和重复等,使得任务长度和类型可以独立变化。字段包括:id(基准套件/场景)、benchmark(来源基准套件)、instruction(复合指令)、subtasks(有序子任务列表)、n_goals(目标数量,接力任务中可能不等于子任务数)、ordered(是否必须按顺序完成)、family(RoboLab任务族,其他套件为空)、distractors(干扰物对象)、image_main(重置帧图像)、image_wrist(腕部相机图像,仅RoboLab有)。数据集中61个样本带有帧图像,其余41个暂仅有标签。

This dataset is used for long-horizon subtask decomposition tasks. Given an initial frame image of a desktop manipulation scene and a composite instruction, the model needs to generate a series of ordered single pick-and-place subtasks required to complete the instruction. Each sample corresponds to a scene. The frame images and labels come from three long-horizon composite benchmark suites built on SimplerEnv (WidowX/Bridge), RobotArena (WidowX), and RoboLab (Franka). The frame image of each sample is the reset observation image actually seen by the orchestrator during evaluation, with the same camera viewpoint, deterministic layout, and instruction string. The labels are ground truth, sourced from the task registry of each suite, and strictly verified to ensure that the subtask sequence matches the real plan in the plan cache. The dataset contains 102 scenes, of which 23 scenes require tasks to be executed in order (ordered), and the number of goals per scene ranges from 1 to 10. Task types include single goal, split goal, transfer, relay, revisit, exclusion, ordered, and repetition, allowing task length and type to vary independently. Fields include: id (benchmark/scene), benchmark (source benchmark suite), instruction (composite instruction), subtasks (ordered list of subtasks), n_goals (number of goals, which may not equal the number of subtasks in relay tasks), ordered (whether it must be completed in order), family (RoboLab task family, empty for other suites), distractors (distractor objects), image_main (reset frame image), image_wrist (wrist camera image, only available for RoboLab). 61 samples in the dataset come with frame images, while the remaining 41 currently only have labels.

创建时间:
2026-08-05
原始信息汇总

数据集概述:Long-horizon subtask decomposition

基本信息

  • 任务类型:image-text-to-text(图像-文本到文本)
  • 语言:英语(en)
  • 标签:机器人学、视觉语言模型、任务分解、长程操作
  • 数据规模:共 102 条样本(n<1K),全部为训练集
  • 许可证:其他(other)
  • 下载大小:约 20.7 MB

数据集内容

该数据集用于长程桌面操作场景的子任务分解任务。给定桌面操作场景的初始帧和复合指令,模型需生成完成该指令的有序单项拾取-放置子任务列表。每条数据对应一个场景。

数据来源包括三个基于 SimplerEnv(WidowX/Bridge)、RobotArena(WidowX)和 RoboLab(Franka)构建的长程组合套件。每行的帧为推理时编排器实际看到的重置观测(相同相机、确定性布局、相同指令字符串)。

数据标注

  • 标签为真实值(ground truth),非模型输出。每个套件带有跟踪计划缓存,其 _meta.roleground truth
  • 所有计划均源自该套件的任务注册表并经过校验。数据集的 subtasks 列为这些计划的逐字记录。
  • 模型自身的分解结果将根据这些标签进行评分,且不会与标签合并。

数据分布

基准(Benchmark) 场景数 有序场景数 每场景目标数
simplerenv_comp 54 15 1–10
robotarena_comp 23 4 2–8
robolab_comp 25 4 1–10
总计 102 23

任务类型涵盖单一目的地、分离目的地、转移、中继、重访、排除、有序和重复等,长度和类型可独立变化。

数据字段

字段 含义
id <benchmark>/<scene>
benchmark 所属基准套件(simplerenv_comp、robotarena_comp、robolab_comp)
instruction 策略读取的复合指令
subtasks 真实值的有序子任务列表
n_goals 场景评分的目标数。除中继任务(需通过中间容器进行两次放置)外,等于 subtasks 长度
ordered 目标是否必须按列出顺序完成。对于后段在前段之前不可能完成的任务链(中继、重访)以及指令中明确顺序的任务为 True
family RoboLab 任务族(single_dest、split、relay、transfer 等);其他套件为空
distractors 存在但不属于任何目标的对象
image_main 重置帧,即编排器看到的画面
image_wrist 腕部相机(仅 RoboLab 套件)

帧覆盖情况

  • 102 行中有 61 行带有帧,其余 41 行目前仅包含标签:其中 11 个 SimplerEnv 场景和 5 个 RobotArena 场景为新增场景,而全部 25 个 RoboLab 场景在之前版本后基于测量资产重建了布局,导致旧帧失效。
  • 帧仅在场景布局输入被证明未改变时才会被复用(包括对象、容器、尺度、生成覆盖和抖动),因此每行要么显示正确的帧,要么不显示帧,绝不会有过期帧。
  • 未覆盖的帧将由各套件的 export_scenes 重新渲染,并在后续修订版本中补充。
搜集汇总
数据集介绍
longhorizon-subtask-decomposition 数据集图片
构建方式
在长时程操作策略评估中,编排器需将复合指令分解为子任务流,其判断能力直接决定任务成败。该数据集从三个仿真长时程操作套件(SimplerEnv-Comp、RobotArena-Comp、RoboLab-Comp)中提取数据,依据仿真器自身逐目标谓词进行标注。分解配置直接由各套件任务注册表导出,涵盖复位帧与复合指令;子任务状态配置则从已记录策略 rollout 中截取中间帧,并附完整特权目标状态。采样时要求目标向量在±8步内稳定,排除成功与失败情境中的模糊帧,从而确保标签可信。
使用方法
通过 datasets 库加载分解与子任务状态两个配置,分解任务输入复位帧与复合指令,输出子任务列表;验证任务针对单个子任务判断完成与否;状态跟踪需对每个不同子任务字符串逐一查询;下一步子任务则发送复合指令并比对未完成目标。评估时使用已部署提示词,避免提示调优,并确保推理令牌充足,防止截断误判。离线得分可用于筛选和排序编排器视觉语言模型,排名靠前者再接受完整闭环评估。
背景与挑战
背景概述
长时域操作任务因其目标多样、步骤冗长,长期困扰机器人学习领域。为将复合指令可靠拆解为可执行子任务,操作调度器需借助视觉语言模型完成规划、验证与状态追踪。LongHorizon Orchestrator Benchmark于2026年发布,由研究者构建,将上述判断从仿真闭环中剥离,形成可快速评估的离线基准。其数据源自SimplerEnv-Comp、RobotArena-Comp与RoboLab-Comp三个仿真长时域操作套件,标签由仿真器特权谓词生成,保证离线评分与闭环评估共享同一成功定义。该基准为视觉语言模型在机器人调度中的角色提供了可复现、低成本的排序手段,对具身智能的规划与验证研究具有推动作用。
当前挑战
基准所面对的核心挑战在于长时域操作中复合指令的分解与状态追踪:模型须从像素判断子任务是否完成、辨认已达成目标,并给出下一步指令,而错误的正例或冗余指令会直接浪费真实执行预算。构建过程中,子任务状态样本须在目标向量稳定区间内截取,避开释放后的谓词抖动与悬停模糊阶段,并拒绝帧数与记录步数不符的整段录像;同时需保证样本来自真实策略 rollout 而非合成,以维持状态分布的部署相关性。此外,离线评分须与闭环结果保持同步,历史版本与当前版本因提示词和样本集变更而不可直接比较,这要求持续维护参考评分器与数据溯源。
常用场景
经典使用场景
在机器人长时程操作任务中,智能体需将复合指令如“把所有物品放入箱中”拆解为一系列单物体子任务,并实时判断各子任务完成状态。该数据集聚焦于操作编排器委托给视觉语言模型的四类核心判断:规划分解、完成验证、状态跟踪与下一步子任务生成。其经典使用场景在于离线基准测试,利用重置帧与指令评估分解能力,或借助情节中的帧与真值标签评估验证、跟踪与生成能力,从而在数分钟内完成模型排序,替代耗时数小时的仿真闭环评估。
解决学术问题
该数据集解决了视觉语言模型在长时程操作中缺乏细粒度、可复现评估基准的学术难题。传统闭环仿真评估成本高昂且难以分离编排器的各项判断能力,而本数据集通过模拟器自身特权谓词标注,将规划、验证、状态跟踪等判断解耦为独立任务,使研究者能够精确诊断模型在完成判断与工作提议间的能力差异,并揭示如“冗余命令”等真实开销来源。其意义在于为编排器视觉语言模型提供统一、可追踪的成功定义,推动可复现的鲁棒性研究。
实际应用
在实际机器人部署中,该数据集支撑操作编排器的模型选型与快速筛查。开发者可利用其离线基准在少量API调用内评估不同视觉语言模型在验证、状态跟踪及子任务生成上的表现,从而为特定机器人平台选择最优模型组合。例如,在SimplerEnv-Comp或RoboLab-Comp等仿真套件中,离线验证准确率与闭环成功率呈强相关,可指导实际系统的编排策略设计,降低仿真测试成本并加速迭代周期。
数据集最近研究
最新研究方向
长时程操作任务中,视觉语言模型(VLM)作为高层编排器的研究正从端到端策略转向模块化判断。该数据集通过离线基准将分解、验证、状态跟踪与下一步子任务生成四个关键判断解耦,使VLM评估从耗时的模拟器闭环中解放。当前前沿聚焦于利用VLM的零样本推理能力进行子任务规划与进度验证,并探索模型组合策略(如用不同模型分别负责验证与生成)以平衡成本与性能。该基准与闭环评估的高度相关性(Spearman 0.89)为快速筛选编排器配置提供了可靠依据,推动了可扩展、可复现的机器人长时程任务研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务