遇见数据集

UniETP

收藏
arXiv2026-07-20 更新2026-07-22 收录
数据链接:
官方服务:

资源简介:

UniETP是由北京大学研究团队构建的具身任务规划统一基准数据集,旨在解决现有模拟器与数据集碎片化问题,推动通用化具身智能体发展。该数据集整合了AI2-THOR、VirtualHome、Habitat和BEHAVIOR四大主流模拟器,通过自动化任务生成流程创建了超过500个任务实例,涵盖138种任务类型,并支持多粒度观察与动作空间。数据集构建过程基于100余个任务模板,结合常识知识库与大语言模型标注器,系统化生成具有不同逻辑复杂度、实例级 grounding 和语言理解难度的任务。其核心应用于评估具身任务规划模型的泛化能力,特别是在跨模拟器环境下的指令理解、复杂逻辑推理和实例级交互规划等关键挑战。

UniETP is a unified benchmark dataset for embodied task planning constructed by a research team at Peking University, which aims to address the fragmentation issue of existing simulators and datasets and advance the development of general-purpose embodied AI agents. This dataset integrates four mainstream simulators including AI2-THOR, VirtualHome, Habitat and BEHAVIOR, generates over 500 task instances through an automated task generation pipeline, covers 138 task types, and supports multi-granularity observation and action spaces. The dataset construction process is based on more than 100 task templates, combined with common sense knowledge bases and large language model-based annotators, to systematically produce tasks with varying logical complexity, instance-level grounding and language understanding difficulty. Its core application is to evaluate the generalization capability of embodied task planning models, particularly regarding key challenges such as instruction understanding, complex logical reasoning and instance-level interactive planning across simulator environments.

提供机构:
北京大学
创建时间:
2026-07-20
原始信息汇总

UniETP 数据集概述

数据集名称: UniETP(Unifying Environments for Generalizable Embodied Task Planning)

核心定位: 用于开发和评估可泛化具身任务规划智能体的统一基准。

主要特点

  • 四合一模拟器接口: 集成 AI2-THOR、VirtualHome、Habitat 和 BEHAVIOR 四种模拟器,提供统一的观察空间、动作空间、场景图表示和评估协议。
  • 可调节评估难度: 提供三种模式(M1/M2/M3),分别调整场景先验、动作粒度和定位要求。
  • 丰富的任务覆盖: 包含 138 个任务模板,覆盖对象状态、空间关系、时间约束、量化计数和组合目标。
  • 自动任务生成: 支持任务模板自动实例化、场景落地、脚本专家策略验证,并转化为自然语言指令。
  • 细粒度诊断分析: 按能力维度划分任务,暴露长程规划、场景探索和实例级视觉定位的瓶颈。

评估能力维度

  • 原子能力
  • 组合能力
  • 逻辑推理
  • 语言理解
  • 实例定位

开发状态

数据与代码正在积极开发中,敬请期待后续更新。

搜集汇总
数据集介绍
UniETP 数据集图片
构建方式
UniETP通过统一的环境层与任务层架构实现数据集的构建。环境层将AI2-THOR、VirtualHome、Habitat和BEHAVIOR四个主流模拟器整合至标准化的观测与动作空间,并定义统一场景图作为环境抽象表示,以支持跨模拟器的统一评估逻辑。任务层则基于138种任务模板,借助常识知识库与大语言模型注释器,自动生成任务实例,涵盖原子任务与长序列组合任务,并最终通过脚本化专家策略验证任务可行性。
特点
该数据集的核心特点体现为标准化与多样性的深度融合。一方面,它通过统一观测空间(包含局部视图、全局信息与动作反馈)和参数化动作空间(涵盖导航与操作),实现了跨模拟器的一致性交互接口。另一方面,任务设计在指令理解、复杂逻辑(如时序约束、全称量化)、实例级目标定位等维度进行精细化构建,从而支持对具身智能体规划能力的多粒度、多维度评估。
使用方法
使用者可通过统一接口驱动智能体在多个模拟器环境中执行任务规划。数据集提供三种难度等级的评估模式(M1/M2/M3),分别控制场景先验信息的多少、动作粗粒度的级别以及感知定位的负担,以灵活适配不同能力水平的模型测试。同时,配套的自动生成流水线可产出大规模训练数据,支持对预训练模型进行监督微调,从而提升智能体在未见模拟器与任务类型上的泛化能力。
背景与挑战
背景概述
具身任务规划(Embodied Task Planning, ETP)是具身智能领域的核心问题之一,要求智能体在交互环境中依据自然语言指令执行一系列原子动作以完成复杂任务。近年来,尽管诸如AI2-THOR、VirtualHome、Habitat和BEHAVIOR等多种仿真器及相应数据集层出不穷,但各平台在观测格式、动作空间与任务领域上彼此割裂,导致模型难以跨平台迁移与泛化。由北京大学徐沛然、郑嘉琪与牟亚东教授团队于2026年提出的UniETP数据集,旨在打破这一壁垒,通过构建统一的观测与动作接口,将四种主流仿真器整合至同一框架之下。UniETP不仅定义了多粒度评估模式(M1/M2/M3),还引入涵盖逻辑推理、语言理解与实例级定位等维度的自动化任务生成管线,形成了含有536个基准任务与9000个训练任务的大规模评测平台,推动了具身规划研究向标准化与多样化迈进的进程。
当前挑战
UniETP所应对的核心挑战源自现有具身规划基准的碎片化。首先,不同仿真器在场景规模、视觉风格、物理规则及交互能力上各具特色,导致数据集间观测格式与动作空间迥异,模型难以跨平台泛化,训练数据的规模化与多样性亦受抑制。其次,现有基准在任务设计上多局限于目标状态评估,忽视了对时间约束、全称量词、计数聚合等复杂逻辑结构以及间接描述、干扰信息等语言理解维度的覆盖,且实例级定位要求稀缺,使得模型无法在细粒度能力维度得到全面检验。在构建过程中,UniETP需克服多仿真器间动作语义对齐的异质性难题,并借助常识知识库与大语言模型标注器实现百级任务模板的自动实例化与可行性验证,确保生成的指令与目标公式紧密契合,最终搭建起可供闭源与开源视觉语言模型公平竞技的评估框架。
常用场景
经典使用场景
在具身智能研究领域中,UniETP作为首个统一多模拟器的具身任务规划基准,其最经典的使用场景在于评估和比较不同视觉-语言模型在异构仿真环境中的任务规划能力。通过整合AI2-THOR、VirtualHome、Habitat和BEHAVIOR四个主流模拟器,UniETP为研究者提供了一个标准化的观测与动作接口,允许在一致的协议下开展跨模拟器的模型性能测试。该数据集特别适用于研究智能体在不同场景规模、视觉外观、物理规则和交互复杂度下的泛化能力,已成为分析当前大模型在长时序、多步骤家庭任务中决策瓶颈的核心工具。
衍生相关工作
UniETP的出现催生了一系列围绕具身规划泛化性的重要研究工作。其统一接口设计直接启发了后续跨模拟器迁移学习方法,研究者开始探索如何利用该基准的训练集数据进行监督微调,以提升模型在未见过的模拟器或任务类型上的表现。实验表明,在UniETP上微调的小规模模型甚至能超越参数更大的通用模型,这推动了数据驱动型具身智能体开发范式的流行。此外,该基准对实例级定位、复杂逻辑和语言理解维度的精细划分,促使学术界涌现出专门针对场景图记忆增强、空间推理强化和失败反思机制等方向的模型改进工作。
数据集最近研究
最新研究方向
在具身智能领域,任务规划(Embodied Task Planning, ETP)正从孤立、异构的仿真环境研究向统一化、泛化性方向发展。前沿研究聚焦于构建标准化的环境接口与观测-动作空间,以整合AI2-THOR、VirtualHome、Habitat、BEHAVIOR等多款主流模拟器,打破以往各仿真平台在数据格式、任务逻辑与评估协议上的碎片化壁垒。近期热点包括利用大语言模型与常识知识库自动生成涵盖原子操作、组合任务、逻辑约束、复杂指令及实例级物体定位的多维度、多难度层级的大规模基准数据集,并配套可调节难度的评估协议(如逐步减少场景先验信息、限制动作粒度)。该研究方向的核心意义在于:不仅为现有多模态大模型(如GPT、Gemini、Claude)和具身基础模型提供了更公平、更具挑战性的闭环交互评测平台,更通过消除模拟器间的鸿沟,显著促进了具身智能体在未见环境与未见任务上的泛化能力——实验表明,统一接口下的微调训练在不依赖目标场景数据时仍能带来性能跃升,这为迈向通用具身任务规划器奠定了数据与基准层面的关键基础。
相关研究论文
  • 1
    UniETP: Unifying Environments for Generalizable Embodied Task Planning北京大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务