遇见数据集

SPACEREJECT

收藏
arXiv2026-06-16 更新2026-06-17 收录
官方服务:

资源简介:

SPACEREJECT是由RGA公司创建的空间定位拒绝基准数据集,旨在评估具身智能体在长视频记忆中对不可回答查询的拒识能力。该数据集包含135个精心设计的不可回答查询,覆盖六个不同的校园环境视频序列,每个序列约45个查询,通过扩展SPACELOCQA基准构建而成。数据创建过程基于对原始可回答查询的系统性语义翻转和视觉记忆篡改,生成缺乏跨模态 grounding 的样本。该数据集主要应用于具身视觉语言模型的鲁棒性评估领域,解决空间导航任务中智能体对无解查询的过度自信问题,防止机器人产生误导性导航指令。

SPACEREJECT is a spatial localization rejection benchmark dataset developed by RGA Corporation, which aims to evaluate the capability of embodied AI Agents to reject unanswerable queries during reasoning over long-form video memories. This dataset includes 135 meticulously designed unanswerable queries, covering six distinct campus environment video sequences with approximately 45 queries per sequence, and is constructed by extending the SPACELOCQA benchmark. The dataset creation process relies on systematic semantic inversion and visual memory tampering applied to the original answerable queries, generating samples that lack cross-modal grounding. This dataset is primarily applied in the field of robustness evaluation for embodied vision-language models, aiming to address the overconfidence problem of agents towards unsolvable queries in spatial navigation tasks and prevent robots from generating misleading navigation instructions.

提供机构:
RGA公司
创建时间:
2026-06-16
原始信息汇总

数据集概述:Semantic Flip

核心概念

Semantic Flip 是一个用于具身问答空间定位中的鲁棒拒绝机制的合成OOD(分布外)数据生成框架。它通过从分布内数据中合成OOD查询-记忆对,训练一个轻量级的拒绝模块,使具身视觉-语言代理学会在视觉记忆无法支持查询时拒绝回答。

关键方法

  • Q-Flip:将问题改写为无法接地(ungrounded)的变体,保持视频记忆不变。
  • V-Flip:保持问题不变,通过“解析→检测→修复”(spaCy、Grounding-DINO、LaMa)流程从记忆中擦除问题的指代对象。
  • 冻结的VLM编码器为分布内样本、Q-Flip和V-Flip样本生成联合嵌入,仅训练一个3层MLP拒绝门

基准数据集

AbstainEQA (HM3D-380)

  • 基于HM3D场景构建
  • 通过确定性划分重建(SEED = 42)

SpaceReject / SpaceRejectExtra

  • 新的空间定位拒绝基准,用于长视频记忆中的故意不可回答查询
  • 包含查询、视频、标注和训练模型,即将在 Hugging Face 上发布

实验结果

AbstainEQA (HM3D-380)

指标 数值
F1 0.7110
Balanced Accuracy 0.6684
Recall 0.8158
Specificity 0.5211

SpaceReject(长视频记忆空间定位)

方法 Balanced Accuracy F1 Recall Specificity
Semantic Flip (Q-Flip + V-Flip) 0.9563 0.9559 0.9467 0.9659

使用环境与依赖

  • 硬件要求:单个48 GB GPU(如RTX A6000)
  • Python版本:3.10+
  • 深度学习框架:PyTorch 2.x
  • 基础模型:Qwen2.5-VL-7B-Instruct、Qwen2.5-VL-32B-Instruct-AWQ、Qwen2.5-7B-Instruct、grounding-dino-tiny
  • 模型来源:Hugging Face Hub(首次使用时自动下载)

仓库结构

SemanticFlip/ ├── notebooks/ # 复现实验的统一Jupyter笔记本 ├── src/ │ ├── synthesis/ # Q-Flip和V-Flip生成器 │ ├── gate/ # 集成MLP拒绝门 │ └── data/ # HM3D / AbstainEQA数据加载器 ├── baselines/ # 基于提示和学习的基线方法 ├── configs/ # 实验配置 ├── assets/ # 图表 ├── docs/ # 项目页面 └── requirements.txt

安装步骤

bash git clone https://github.com/ndb796/SemanticFlip.git cd SemanticFlip conda create -n semflip python=3.10 -y conda activate semflip pip install -r requirements.txt

引用信息

bibtex @article{na2026semanticflip, title = {Semantic Flip: Synthetic OOD Generation for Robust Refusal in Embodied Question Answering and Spatial Localization}, author = {Na, Dongbin and Kim, Chanwoo and Choi, Giyun and Hong, Dooyoung}, year = {2026} }

联系信息

  • Dongbin Na:dongbinna@postech.ac.kr
  • Dooyoung Hong:dooyoung@rgarobot.com
搜集汇总
数据集介绍
SPACEREJECT 数据集图片
构建方式
SPACEREJECT 数据集是在 SPACELOCQA 的基础上构建的,旨在评估具身智能体在长视频记忆背景下对不可回答查询的拒绝能力。原始的 SPACELOCQA 包含六个校园视频序列,每个序列有 45 个可回答的空间问题,共 270 个查询。为了创建平衡的测试集,数据集将六个序列按序列级别分为训练集(序列 0、1、2)和测试集(序列 3、4、5),确保训练与测试图像之间无视觉重叠。在测试集中,除了保留的 135 个可回答查询外,新增了 135 个精心策划的不可回答查询,涵盖两种类型:一是目标对象在视频中从未出现(68 个查询),二是 RGB 观测无法确定的属性(67 个查询)。不可回答查询的生成过程包括:首先使用大语言模型根据场景描述草拟候选查询,然后由三位机器人专家独立验证每个候选查询与视频记录的一致性,仅保留三方均同意的查询。这一严格的验证流程确保了数据集的可靠性和多样性。
特点
SPACEREJECT 的核心特点在于其专门针对空间定位任务中的拒绝行为进行基准测试,弥补了现有数据集在此方向上的空白。该数据集具有平衡的 1:1 正负样本分布(135 个可回答与 135 个不可回答查询),能够全面评估模型的拒绝性能。不可回答查询类型设计得具有实际意义:Type 1(对象缺失)模拟用户询问视频中从未出现的物体,Type 2(视觉不可获取)模拟询问超出 RGB 观测能力的信息。这种分类使得评估结果能够反映模型在不同真实场景中的鲁棒性。此外,数据集还提供了 SPACEREJECTEXTRA 扩展版本,包含 2520 个跨五种拒绝类型的新增不可回答查询,支持更大规模的评估。序列级别的划分确保了评估的严谨性,避免了数据泄露。
使用方法
SPACEREJECT 作为测试基准,可直接与具身问答或空间定位管道集成。评估时,将模型在测试集上输出,计算其在不回答决策上的 F1 分数、平衡准确率、召回率和特异性等指标。具体使用中,可将 SEMANTIC FLIP 框架的轻量级拒绝模块作为插件挂接到现有视觉语言模型(如 Qwen2.5-VL-7B)之上,利用冻结的编码器提取多模态嵌入,并由一个三层 MLP 分类器判断是否为不可回答查询。在空间定位任务中,该模块可以嵌入到 META-MEMORY 智能体的循环内(如作为第四个推理工具),在智能体生成坐标前进行拒绝决策,从而避免机器人执行无意义的导航指令。数据集和代码已在 GitHub 上公开,支持复现和扩展研究。
背景与挑战
背景概述
SPACEREJECT数据集由RGA Inc.的研究人员Dongbin Na、Chanwoo Kim等人在2026年提出,旨在解决具身智能体在空间定位任务中面对不可回答查询时的拒绝响应问题。该数据集基于SPACELOCQA扩展而来,包含135个经过精心设计的不可回答查询,覆盖物体缺失和视觉不可获取两种实际拒绝类型。在具身问答和空间导航领域,现有视觉语言模型往往对缺乏视觉支撑的查询产生过度自信的误导性回答,SPACEREJECT的诞生为评估和训练具身智能体的健壮拒绝能力提供了标准化基准,推动了可靠部署的关键技术发展。
当前挑战
SPACEREJECT面临的挑战具有双重维度。在领域问题层面,具身智能体需要区分可回答与不可回答的查询,防止在空间定位中输出错误坐标引导用户,这对机器人的安全导航至关重要。在构建过程中,研究人员需要确保生成的不可回答查询既合理又不可被视觉记忆回答,他们通过LLM初稿加三位机器人专家独立验证的严格流程,仅保留共识一致的查询。此外,由于训练数据仅包含可回答样本,如何在不依赖外部OOD标注的情况下合成有效的拒绝对抗样本,成为构建过程中的核心技术难题。
常用场景
经典使用场景
在具身智能与视觉语言模型的交叉领域中,当移动机器人在部署阶段接收到自然语言查询时,常常面临查询无法被已有视觉记忆充分支持的情境。SPACEREJECT数据集正是为评估空间定位任务中的拒绝机制而精心构建的基准。它基于SPACELOCQA的六段校园视频序列,巧妙地将原始的270个可回答空间查询扩展为包含对象缺失与视觉不可达两类无法回答查询的平衡测试集。该数据集的经典使用场景在于,研究者可以借助它系统性地评测具身智能体在面对超出感知能力范围或缺乏视觉证据支持的空间查询时,是否能够做出恰当的拒绝决策。通过精心设计的分序列划分,SPACEREJECT确保了评估的公正性,使得跨场景泛化能力的测量成为可能。这一设计为理解具身视觉语言模型在复杂真实环境中的置信度校准行为提供了不可或缺的试验场。
衍生相关工作
SPACEREJECT数据集的发布催生了一系列围绕具身智能体拒绝机制的前沿研究工作。其中最引人注目的衍生工作当属同篇论文提出的SEMANTIC FLIP框架,该框架巧妙地利用查询翻转与视频记忆翻转两种合成策略,在无需额外标注的情况下生成了高质量的训练样本,仅凭极轻量的多层感知机分类头便在SPACEREJECT上达到了0.9559的F1分数。这一成果直接验证了合成异常样本对提升拒绝模型泛化能力的有效性,并为后续研究提供了可复现的方法论基础。此外,SPACEREJECT大规模扩展版SPACEREJECTEXTRA的发布,将无法回答的查询类别扩展至五类完整的拒绝类别,使得更大规模的精细化研究成为可能。这些衍生工作共同构建了一个从基准数据集建立、到轻量级拒绝模块设计,再到大规模评估框架拓展的完整研究生态,为具身智能领域可信赖人机交互的研究人员提供了标准化的实验平台与丰富的基线方法。
数据集最近研究
最新研究方向
在具身智能与视觉-语言模型的交叉领域,拒绝回答机制已成为确保机器人系统可靠运行的关键研究方向。SPACEREJECT数据集的提出,聚焦于空间定位任务中面对长时序视频记忆时,智能体对不可回答查询的鲁棒性拒答能力。该数据集从SPACELOCQA扩展而来,精心构建了135个不可回答的空间定位查询,涵盖目标缺失和视觉不可知两类实际场景,并通过三位专家独立验证确保数据质量。伴随SEMANTIC FLIP框架的提出,研究者通过语义翻转策略合成异常分布样本,在不依赖外部异常标注的条件下,训练轻量级拒绝模块,在冻结的视觉-语言模型上实现了0.9559的F1分数,显著超越了强提示基线。这一研究方向不仅推动了具身问答系统在开放环境中的可靠部署,更揭示了抽象拒答信号学习而非类别特异性线索捕获的核心技术路径,为消除机器人导航中因盲目自信导致的重大失效风险提供了关键方法论支撑。
相关研究论文
  • 1
    Semantic Flip: Synthetic OOD Generation for Robust Refusal in Embodied Question Answering and Spatial LocalizationRGA公司 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务