SPACEREJECT
收藏资源简介:
SPACEREJECT是由RGA公司创建的空间定位拒绝基准数据集,旨在评估具身智能体在长视频记忆中对不可回答查询的拒识能力。该数据集包含135个精心设计的不可回答查询,覆盖六个不同的校园环境视频序列,每个序列约45个查询,通过扩展SPACELOCQA基准构建而成。数据创建过程基于对原始可回答查询的系统性语义翻转和视觉记忆篡改,生成缺乏跨模态 grounding 的样本。该数据集主要应用于具身视觉语言模型的鲁棒性评估领域,解决空间导航任务中智能体对无解查询的过度自信问题,防止机器人产生误导性导航指令。
SPACEREJECT is a spatial localization rejection benchmark dataset developed by RGA Corporation, which aims to evaluate the capability of embodied AI Agents to reject unanswerable queries during reasoning over long-form video memories. This dataset includes 135 meticulously designed unanswerable queries, covering six distinct campus environment video sequences with approximately 45 queries per sequence, and is constructed by extending the SPACELOCQA benchmark. The dataset creation process relies on systematic semantic inversion and visual memory tampering applied to the original answerable queries, generating samples that lack cross-modal grounding. This dataset is primarily applied in the field of robustness evaluation for embodied vision-language models, aiming to address the overconfidence problem of agents towards unsolvable queries in spatial navigation tasks and prevent robots from generating misleading navigation instructions.
数据集概述:Semantic Flip
核心概念
Semantic Flip 是一个用于具身问答和空间定位中的鲁棒拒绝机制的合成OOD(分布外)数据生成框架。它通过从分布内数据中合成OOD查询-记忆对,训练一个轻量级的拒绝模块,使具身视觉-语言代理学会在视觉记忆无法支持查询时拒绝回答。
关键方法
- Q-Flip:将问题改写为无法接地(ungrounded)的变体,保持视频记忆不变。
- V-Flip:保持问题不变,通过“解析→检测→修复”(spaCy、Grounding-DINO、LaMa)流程从记忆中擦除问题的指代对象。
- 冻结的VLM编码器为分布内样本、Q-Flip和V-Flip样本生成联合嵌入,仅训练一个3层MLP拒绝门。
基准数据集
AbstainEQA (HM3D-380)
- 基于HM3D场景构建
- 通过确定性划分重建(SEED = 42)
SpaceReject / SpaceRejectExtra
- 新的空间定位拒绝基准,用于长视频记忆中的故意不可回答查询
- 包含查询、视频、标注和训练模型,即将在 Hugging Face 上发布
实验结果
AbstainEQA (HM3D-380)
| 指标 | 数值 |
|---|---|
| F1 | 0.7110 |
| Balanced Accuracy | 0.6684 |
| Recall | 0.8158 |
| Specificity | 0.5211 |
SpaceReject(长视频记忆空间定位)
| 方法 | Balanced Accuracy | F1 | Recall | Specificity |
|---|---|---|---|---|
| Semantic Flip (Q-Flip + V-Flip) | 0.9563 | 0.9559 | 0.9467 | 0.9659 |
使用环境与依赖
- 硬件要求:单个48 GB GPU(如RTX A6000)
- Python版本:3.10+
- 深度学习框架:PyTorch 2.x
- 基础模型:Qwen2.5-VL-7B-Instruct、Qwen2.5-VL-32B-Instruct-AWQ、Qwen2.5-7B-Instruct、grounding-dino-tiny
- 模型来源:Hugging Face Hub(首次使用时自动下载)
仓库结构
SemanticFlip/ ├── notebooks/ # 复现实验的统一Jupyter笔记本 ├── src/ │ ├── synthesis/ # Q-Flip和V-Flip生成器 │ ├── gate/ # 集成MLP拒绝门 │ └── data/ # HM3D / AbstainEQA数据加载器 ├── baselines/ # 基于提示和学习的基线方法 ├── configs/ # 实验配置 ├── assets/ # 图表 ├── docs/ # 项目页面 └── requirements.txt
安装步骤
bash git clone https://github.com/ndb796/SemanticFlip.git cd SemanticFlip conda create -n semflip python=3.10 -y conda activate semflip pip install -r requirements.txt
引用信息
bibtex @article{na2026semanticflip, title = {Semantic Flip: Synthetic OOD Generation for Robust Refusal in Embodied Question Answering and Spatial Localization}, author = {Na, Dongbin and Kim, Chanwoo and Choi, Giyun and Hong, Dooyoung}, year = {2026} }
联系信息
- Dongbin Na:dongbinna@postech.ac.kr
- Dooyoung Hong:dooyoung@rgarobot.com

- 1Semantic Flip: Synthetic OOD Generation for Robust Refusal in Embodied Question Answering and Spatial LocalizationRGA公司 · 2026年




