遇见数据集

APRS benchmark

收藏
arXiv2026-07-03 更新2026-07-05 收录
数据链接:
官方服务:

资源简介:

APRS基准数据集是由复旦大学研究团队构建的,旨在支持主动全景指代分割任务的大规模评估资源。该数据集包含来自360-Indoor、PANDORA和SUN360的4,971个独特全景场景,共计7,420个标注样本,涵盖了多样化的室内外环境,并设计了包含空间关系推理的复杂语言指令。数据集的创建过程采用了人机协同的标注流程,首先由专业标注员标注显著目标并设置初始视角,随后结合SAM-3等基础模型生成初始掩码并人工 refinement,同时利用VLM进行语义交叉验证以确保可靠性。该数据集主要应用于具身人工智能和计算机视觉领域,旨在解决智能体在连续360度环境中进行主动感知、跨视角空间推理以及目标分割的综合性挑战,推动从被动静态图像处理到主动多视角交互的范式转变。

The APRS Benchmark Dataset was constructed by a research team from Fudan University, serving as a large-scale evaluation resource to support the active panoramic referring segmentation task. This dataset includes 4,971 unique panoramic scenes sourced from 360-Indoor, PANDORA, and SUN360, with a total of 7,420 annotated samples. It covers diverse indoor and outdoor environments, and features complex language instructions that incorporate spatial relation reasoning. The dataset was developed through a human-machine collaborative annotation workflow: first, professional annotators label salient objects and set initial viewing perspectives; subsequently, foundational models such as SAM-3 are employed to generate initial masks, followed by manual refinement, and VLMs are utilized for semantic cross-validation to ensure annotation reliability. This dataset is primarily applied in the fields of embodied artificial intelligence and computer vision, aiming to address the comprehensive challenges faced by AI agents when conducting active perception, cross-view spatial reasoning, and object segmentation in continuous 360-degree environments, and promote the paradigm shift from passive static image processing to active multi-view interaction.

提供机构:
复旦大学
创建时间:
2026-07-03
原始信息汇总

数据集概述

任务定义

Active Panoramic Referring Segmentation (APRS):一个全新的任务,要求智能体在连续的 360° 环境中主动探索,通过调整相机视角(θ, φ)来寻找并分割用户指令指定的目标对象。该任务将传统的被动式指代分割(基于单张固定图像)转变为主动式(探索整个 360° 球面空间)。

数据集规模

  • 4,971 个独特的 360° 场景
  • 7,420 个带有专家标注的样本

场景与标注类型

数据集涵盖多样的室内/室外场景,并包含四种类型的空间指代表达式:

  • EGO(自我中心):相对于智能体朝向的指令,例如“向右转找到沙发。”
  • UNIQ(独特属性):基于显著视觉属性的指令,例如“房间里黄色的落地灯。”
  • ALLO(异我中心):相对于锚定物体的指令,例如“沙发对面的椅子。”
  • MULTIHOP(多跳):多步骤组合推理的指令,例如“转过身,找到桌子旁边的椅子。”

评价协议

数据集提供了全面的评价协议,主要指标包括:

  • SR(Success Rate):成功率
  • AS(Average Steps):平均步骤数
  • SPL(Success weighted by Path Length):路径长度加权成功率
  • mIoU(mean IoU):平均交并比(分割质量)

基线对比

在 APRS 基准上,PanoSeeker 在与静态方法、启发式方法和基于 VLM 的智能体(包括 GPT-5.2 和 Gemini-3)的对比中,在成功率、搜索效率和分割质量上均取得了领先结果。

搜集汇总
数据集介绍
APRS benchmark 数据集图片
构建方式
APRS基准数据集构建于丰富且易获取的全景图像之上,模拟了连续的360度第一人称探索场景,覆盖了多样化的室内外环境。其构建流程包括:首先从360-Indoor、PANDORA和SUN360三个来源收集高分辨率全景图,共计4971个场景,并通过日晷投影从等距柱状全景图中提取局部透视视图,模拟受限视场下的观察;随后采用人工与基础模型结合的标注管线,由专业人员标注目标边界框并构建以轨迹为中心的空间指代表达式,同时利用SAM-3生成初始分割掩码并经人工修正,辅以视觉语言模型进行语义交叉验证以确保数据可靠性。
使用方法
APRS基准要求智能体从初始视角出发,通过迭代调整观察方向(水平与垂直偏移)在360度环境中主动搜索用户指令指定的目标,并在找到目标后输出分割掩码。评估协议从任务成功率、探索效率与分割质量三个维度展开,具体指标包括基于视点距离与分割IoU的成功率、平均步数与路径长度加权成功率,以及平均交并比。数据集提供标准化的训练与测试划分,支持通过与现有方法在静态全景输入、启发式扫描与主动视觉语言智能体三种范式下的比较来验证模型性能。
背景与挑战
背景概述
APRS benchmark由复旦大学宋唐、胡树明、帅新成、丁恒辉、姜玉刚等研究人员于2026年提出,旨在解决具身智能领域中主动感知与全景理解的关键问题。传统指代分割模型被动处理固定视角的静态图像,难以在连续360度环境中根据语言指令主动搜索并分割目标,严重限制了在机器人导航、增强现实等实际场景中的部署。为此,该研究团队创新性地定义了主动全景指代分割任务(APRS),并构建了包含4971个场景、7420个样本的大规模基准数据集。数据集涵盖室内外多样环境,设计了四种空间指代表达(EGO、UNIQ、ALLO、MULTIHOP),全面评估智能体的跨视角空间推理与主动探索能力,为具身AI领域的主动感知研究提供了关键测试平台。
当前挑战
APRS benchmark面临的核心挑战在于将被动视觉感知拓展为主动多视角探索。在360度环境中,智能体需理解复杂跨视角空间关系(如'床对面的地板柜')并自主规划搜索路径,这要求模型具备高效的非冗余探索能力。传统显式3D建模计算成本高昂,而直接处理全景图像会引入严重几何畸变。此外,构建过程中需要设计人类参与的标注流水线,包括从初始视角远离目标、生成轨迹导向的空间指代表达、利用SAM-3等高精度模型辅助分割并进行语义交叉验证。数据集还需处理不同难度级别的空间推理(如多跳推理MULTIHOP),确保评估的全面性与挑战性。
常用场景
经典使用场景
APRS benchmark最经典的使用场景是评估和训练具身智能体在连续360度全景环境中执行主动感知与目标分割任务。该基准要求智能体基于自然语言指令,自主调整视角方向(Δθ, Δϕ)在球面空间中搜索指定物体,并在发现目标后输出分割掩码。它特别适用于测试智能体的跨视角空间推理能力,包括理解自我中心、独有属性、他者中心和多跳这四类空间指代表达,从而模拟真实世界中的主动探索与定位过程。
解决学术问题
该数据集解决了现有参照分割方法依赖固定视角静态图像、缺乏主动探索能力的根本局限。传统的被动式感知模型无法应对360度连续环境中的目标搜索问题。APRS benchmark填补了这一空白,首次将主动感知与全景参照分割任务形式化,提供了涵盖室内外场景的大规模专家标注搜索轨迹数据,并建立了包含成功率、平均步数和路径加权成功率的综合评价协议。它为研究主动空间推理、跨视角物体定位和记忆增强探索策略提供了标准化评估平台,推动了具身智能领域从被动感知向主动感知的范式转变。
实际应用
在实际应用中,APRS benchmark为机器人导航、增强现实和智能监控等场景提供了核心技术支持。例如,家庭服务机器人可以根据用户指令(如"找到沙发对面的落地柜")在未知环境中主动搜索并分割目标物体;AR眼镜能实现基于语言指令的360度环境感知与交互;安防系统可自动定位并分割监控场景中的指定目标。这些应用均要求智能体在连续空间中进行高效、无冗余的主动探索,而APRS benchmark为训练和验证此类系统提供了可靠的数据基础。
数据集最近研究
最新研究方向
当前,主动感知与具身智能的深度融合已成为计算机视觉领域的前沿焦点。APRS benchmark的提出,精准地切入了一个关键瓶颈:现有指代分割模型大多局限于被动处理固定视角的静态图像,难以适应具身智能体在连续360°环境中执行主动搜索与目标分割的实际需求。该基准通过构建涵盖室内外多样场景的360°全景模拟环境,并设计EGO、UNIQ、ALLO、MULTIHOP四类具有递进空间推理难度的指代表达,系统性地推动了从被动感知向主动探索的范式跃迁。PanoSeeker作为该基准上的代表性方法,创新性地融合了EgoSphere空间记忆与强化学习策略,显著提升了在连续全景空间中的搜索效率与分割精度。这一工作不仅为主动感知型指代分割任务确立了标准化评估体系,更对推动具身智能在真实复杂场景中的部署具有里程碑式意义。
相关研究论文
  • 1
    Seek to Segment: Active Perception for Panoramic Referring Segmentation复旦大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务