遇见数据集

RoboSPA

收藏
arXiv2026-09-05 更新2026-09-08 收录
官方服务:

资源简介:

RoboSPA是一个大规模机器人操作数据集与基准,由浙江大学等机构联合构建,旨在系统性评估视觉-语言-动作(VLA)模型的具身推理能力。该数据集包含527K条轨迹和997小时视频,覆盖细粒度空间推理与长程程序规划两大核心维度,共计10个任务类别、56个基础任务,每个任务按5个难度等级扩展为280个变体,并采用5种机器人本体执行,场景涵盖干净与领域随机化环境。数据集基于SAPIEN模拟器和RoboTwin 2.0框架构建,由10名研究生设计任务并经过双重审核,确保了质量与多样性。RoboSPA专注于诊断VLA模型在复杂空间关系、记忆依赖执行及多步程序规划中的瓶颈,为开发更可靠、可泛化的具身智能体提供了具有挑战性的测试平台。

RoboSPA is a large-scale robotic manipulation dataset and benchmark jointly constructed by Zhejiang University and other institutions, aiming to systematically evaluate the embodied reasoning capabilities of vision-language-action (VLA) models. This dataset contains 527K trajectories and 997 hours of video, covering two core dimensions: fine-grained spatial reasoning and long-range procedural planning. It includes a total of 10 task categories and 56 basic tasks, with each basic task expanded into 280 variants across 5 difficulty levels, and is implemented using 5 types of robot embodiments. The scenarios cover both clean environments and domain-randomized settings. Built on the SAPIEN simulator and the RoboTwin 2.0 framework, the dataset's tasks were designed by 10 graduate students and underwent double reviews to ensure quality and diversity. RoboSPA focuses on diagnosing the bottlenecks of VLA models in complex spatial relationships, memory-dependent execution and multi-step procedural planning, providing a challenging testbed for developing more reliable and generalizable embodied AI agents.

创建时间:
2026-09-05
原始信息汇总

数据集概述:RoboSPA

当前状态: 该数据集及配套代码尚未正式发布,目前处于准备阶段。项目页面仅发布了预告声明,表示相关内容“即将推出”,并邀请用户持续关注。

内容说明: 由于数据集文件和代码尚未公开,当前无法提供具体的数据构成、规模、标注格式、应用场景或使用方式等详细信息。页面内未包含任何实质性数据描述或示例。

访问提示: 项目的主页地址为 https://github.com/fanzhenxuan/RoboSPA,但该地址目前仅承载了上述预告信息。建议有意使用者关注该页面的后续更新,以获取正式发布的数据集和代码。

搜集汇总
数据集介绍
RoboSPA 数据集图片
构建方式
RoboSPA数据集依托SAPIEN仿真平台与RoboTwin 2.0框架,构建了一套面向具身推理评估的层级化能力体系。其构建流程严谨而系统:首先,依据细粒度空间推理与长程程序规划两大核心维度,精心设计涵盖几何属性认知、空间距离估计、规范位置索引、参照关系推理与跨视角推理等十类任务范畴,共56个基础任务。每个任务由专家代码定义场景、执行流程与成功条件,并通过双人复核保障质量。为度量推理复杂度的影响,每个基础任务进一步实例化为五个递进难度级别,通过增加候选物体数量或延长动作序列长度实现难度控制,从而衍生出280个任务变体。指令生成环节利用GPT-5.2构建了60条语义多样的模板,并确保训练与测试指令完全隔离。数据采集在干净场景与域随机化场景下同步开展,后者引入了背景、杂乱、桌面高度与光照等多样化扰动,并在五种机器人本体上收集了527K条轨迹,总计超过997小时视频,构成了规模宏大的多本体、多场景评测语料。
特点
RoboSPA数据集的核心特色在于其首创性地将细粒度空间推理确立为VLA模型评估的关键维度,突破了既有基准多聚焦于简单场景与短程任务之窠臼。其层级化能力分类体系摒弃了孤立任务设置,通过递进式难度设计实现了模型性能衰退规律的精确刻画。尤为独特的是,数据在干净场景与域随机化场景的双重覆盖,加之多达五种机器人本体的异构数据采集,为评测模型在视觉鲁棒性与跨本体泛化性提供了坚实基础。指令模板的自动化生成与人工核查相结合,在确保语言学形式丰富多元的同时,维持了语义控制下的一致性,有效规避了训练与测试指令的潜在重叠。此外,数据规模空前宏大,527K条轨迹与近千小时视频的体量远超同类工作,其十类能力范畴与280个任务变体的覆盖面,为系统性诊断模型优势与局限提供了不可多得的实验土壤。更为重要的是,RoboSPA超越了二元成功率的粗粒度评判,引入对象归一化目标准确率与进度得分两项互补性诊断指标,使评测内涵从结果导向深化至过程解析层面,从而实现了对模型推理能力的精细化剖析。
使用方法
RoboSPA作为诊断性基准与训练语料,其使用方法灵活而多层次。在模型评测实践中,研究者可遵循其预设的规范流程:针对每个基础任务,采用全部五个难度级别的数据训练单一模型,并在各难度级别上独立进行推断,以捕捉性能随复杂度攀升的演化轨迹。评测环节设定了每任务变体100次滚动试验,确保了统计稳健性。尤为关键的是,该数据集超越了简单成功率的汇报,鼓励用户借助对象归一化目标准确率去除物体基数所致的偶然基线,公正衡量空间推理能力;同时利用进度得分对长程任务的子目标完成程度进行连续性度量,从而定位模型是在哪个中间环节发生断裂。实验设计亦支持多本体泛化评估,可针对嵌入式平台和场景变体进行交叉验证。此外,数据集中指令模板在训练与测试间的严格隔离,为评测模型的指令泛化能力提供了纯净窗口。研究者既可沿用论文中的全微调范式,亦可借鉴其分层策略进行适配研究,借助高度精细的失败模式标注,深入分析目标接地、精细操控、长时间追踪及记忆依赖等环节的薄弱之处,推动新一代更可靠、可具身泛化的VLA模型研发。
背景与挑战
背景概述
具身智能与视觉-语言-动作(VLA)模型的迅猛发展,催生了对复杂操作任务进行系统性评估的迫切需求。尽管现有数据集与基准在结构化短程任务上已取得显著进展,但对模型在复杂空间与程序化推理能力上的诊断仍显不足。在此背景下,由浙江大学等机构的研究团队于2026年构建的RoboSPA(Robot Spatial-Procedural Assessment)数据集应运而生。该数据集聚焦于细粒度空间推理与长程程序规划两大核心维度,覆盖10个任务类别、56个基础任务及280个变体,并基于SAPIEN仿真器与RoboTwin 2.0框架,汇集了跨越5种具身形态、涵盖清洁与域随机化场景的527K条轨迹及997小时视频。RoboSPA旨在弥补现有基准在空间歧义消解、程序步骤可扩展性及逐步诊断性评估上的不足,为VLA模型的推理能力提供更为严苛的测试平台,对推动通用具身智能体发展具有重要参考价值。
当前挑战
构建RoboSPA面临的核心挑战源于两方面。领域层面,日常操作任务对VLA模型提出了超越简化场景与短程指令执行的严苛要求,包括:在视觉相似候选对象中,依赖细微空间线索(如几何属性、距离、参照关系及跨视角提示)进行目标消歧的细粒度空间推理;在多步决策中执行长程程序,并应对顺序约束、复合动作协调及高强度记忆负荷带来的累积误差;以及随着候选对象数量、操作时长与环境多样性的增加,实现复杂度可扩展的具身推理。数据构建方面,则需要系统性地设计并部署10个类别、280个难度可控的任务变体,同时保证场景仿真(涉及581种对象资产、多种桌台布局与光照)与跨5种机器人形态的数据一致性,并在527K条轨迹及997小时视频的数据规模下实现逐步级别的成功判定与诊断性指标计算。上述挑战共同构成了当前VLA模型能力评估与发展的关键瓶颈。
常用场景
经典使用场景
RoboSPA作为大规模机器人操作数据集,其经典使用场景聚焦于评估和诊断视觉-语言-动作(VLA)模型在日益复杂的空间推理与程序规划任务中的表现。该数据集精心构建了涵盖细粒度空间推理与长时域程序规划两大核心维度的十个任务类别、五十六个基础任务,并通过五级难度递增形成二百八十个变体,为研究者提供了一个系统剖析模型在复杂场景下推理能力的规范化平台。在典型评估流程中,研究者可在单一任务设定下,利用跨五级难度的数据训练与测试模型,从而清晰观察性能随空间歧义性和程序复杂度增长而衰减的趋势。
衍生相关工作
RoboSPA的提出为一系列后续研究奠定了坚实基础,衍生出多个方向的经典工作。其分层能力分类法与多级难度设计理念被借鉴于构建更具挑战性的空间推理基准,而其引入的目标归一化准确率与进度分数亦成为评估长时域任务细致进展的常用指标。在模型层面,研究者基于RoboSPA暴露出的目标定位缺陷,发展了结合空间引导与对象中心感知的增强框架;针对程序规划中的记忆失灵与序次混淆,衍生出融入显式记忆模块与进度跟踪机制的新型策略。此外,该数据集对跨具身与场景鲁棒性的重视,推动了多形态数据融合与仿真到现实迁移方法的研究热潮。这些工作共同推动了VLA模型向更高阶具身推理能力迈进。
数据集最近研究
最新研究方向
RoboSPA数据集的发布标志着具身智能研究从简单场景向复杂空间与长程任务推理的深度拓展。该基准聚焦于细粒度空间推理与长时程过程规划两大核心能力,通过系统化的难度分级和跨本体、跨场景的大规模数据收集,揭示了当前视觉-语言-动作(VLA)模型在空间关系理解、精确低级执行及记忆密集型规划方面的显著不足。这一诊断性评估框架不仅为开发更具泛化性与可靠性的具身智能体提供了关键测试平台,也推动了VLA模型向更复杂的真实世界任务迈进,对机器人学习领域的发展具有深远影响。
相关研究论文
  • 1
    RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?浙江大学; 电子科技大学; 华南师范大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务