遇见数据集

FudanCVL/APRS_dataset

收藏
Hugging Face2026-07-09 更新2026-07-22 收录
官方服务:

资源简介:

APRS(主动全景参考分割)是一个用于360°全景环境中主动感知的大规模基准数据集。与处理静态图像的被动参考分割不同,APRS要求智能体通过调整观察方向来主动探索连续全景场景,以根据自然语言指令寻找和分割目标。数据集包含7,420个样本,覆盖4,971个多样化的全景场景,包括室内和室外环境。它提供四种类型的空间参考表达:以自我为中心(第一人称方向参考,如“向左看以找到...”)、独特属性(对象特征,如“红色沙发”)、以他者为中心(第三人称空间关系,如“靠近窗户的椅子”)和多跳(复杂关系推理,如“向左看找到床,然后找到旁边桌子上的台灯”)。

APRS (Active Panoramic Referring Segmentation) is a large-scale benchmark dataset for active perception in 360° panoramic environments. Unlike passive referring segmentation that processes static images, APRS requires agents to actively explore continuous panoramic scenes by adjusting viewing directions to seek and segment targets based on natural language instructions. The dataset includes 7,420 samples across 4,971 diverse panoramic scenes, covering both indoor and outdoor environments. It features four types of spatial referring expressions: Egocentric (first-person directional references, e.g., look left to find...), Unique-Attribute (distinctive object features, e.g., the red sofa), Allocentric (third-person spatial relations, e.g., the chair near the window), and Multi-hop (complex relational reasoning, e.g., look to the left to find the bed, then find the lamp on the table next to it).

提供机构:
FudanCVL
搜集汇总
数据集介绍
FudanCVL/APRS_dataset 数据集图片
构建方式
APRS数据集(Active Panoramic Referring Segmentation)是针对360°全景环境下主动感知任务构建的大规模基准数据集。其构建基于4,971个多样化的全景场景,涵盖了室内与室外环境,并通过人工标注生成了7,420个样本。每个样本包含自然语言指令与空间目标标注,其中空间参照表达被精心设计为四类:自我中心定向、独特属性标识、他者中心空间关系以及多跳复杂推理。数据集不仅提供了目标点与边界框在像素坐标系和归一化坐标系下的精确位置,还保存了对应的球面坐标(水平角θ与垂直角φ),以支持全景图像的视角探索与定位。
特点
APRS数据集的核心特点在于其主动感知机制——智能体需根据自然语言指令,通过调整观察方向在连续全景场景中主动搜索并分割目标,而非被动处理静态图像。数据集中的空间参照表达涵盖了从简单定向到多跳推理的四种类型,全面评估模型的空间推理与主动探索能力。此外,每个样本均记录初始视角与目标视角的球面坐标,模拟真实世界中相机位姿的动态调整过程。这种设计使得APRS成为首个聚焦全景主动感知的基准,为机器人导航、增强现实等领域的空间理解研究提供了关键测试平台。
使用方法
使用APRS数据集可通过官方提供的Python类APRSDataset直接从HuggingFace Hub加载,指定分割(如'train')后即可访问样本的指令、类别、视角坐标及图像数据。支持加载全景图像并获取像素坐标下的目标边界框。为便于交互式探索,官方仓库提供了360°可视化工具,支持鼠标拖拽旋转视角、键盘导航及重置初始视角,并可突出显示目标区域。此外,数据集以MIT许可证发布,兼容主流深度学习框架,适用于训练与评估全景主动感知、视觉定位及指代分割等任务的模型。
背景与挑战
背景概述
主动全景感知是计算机视觉领域的前沿方向,旨在赋予智能体在360°环视环境中通过主动调整视角来理解场景的能力。APRS(Active Panoramic Referring Segmentation)数据集由复旦大学视觉与学习实验室的唐松、胡书铭、帅鑫成、丁恒辉和姜育刚等研究人员于2026年创建,发表于arXiv,专注于全景主动指代分割任务。该数据集包含4,971个多样化室内外全景场景中的7,420个样本,涵盖四种空间指代表达类型(自我中心、独特属性、他者中心和多跳推理)。APRS通过提供连续的主动探索范式,突破了传统指代分割依赖静态图像的局限,推动了空间推理与主动感知的交叉研究,对机器人导航、增强现实等应用具有重要价值。
当前挑战
APRS数据集所解决的领域核心挑战在于将被动指代分割拓展至主动感知场景,要求智能体在未知的全景环境中根据自然语言指令主动调整视角以定位与分割目标,这涉及视角选择、语义理解与空间推理的深度融合。构建过程中面临的主要挑战包括:1)设计涵盖多种空间关系(如自我中心、他者中心和多跳推理)的多样化指代表达,确保数据集能够全面评估模型的空间推理能力;2)在4,971个室内外全景场景中精确标注目标点的球面坐标(θ, φ)与边界框,保证标注的一致性与准确性;3)模拟主动探索过程,定义初始视角与目标视角之间的动态关系,为模型提供可学习的探索策略基准。
常用场景
经典使用场景
APRS数据集作为全景主动感知与指向性分割领域的前沿基准,其经典使用场景聚焦于引导智能体在360°环视环境中依据自然语言指令进行动态视觉探索与目标分割。该数据集包含4,971个多样化室内外全景场景,并提供7,420组标注样本,涵盖自我中心定向、独特属性识别、他者空间关系及多跳推理四种空间指涉表达。研究者借助该数据集可训练模型在初始未知视角下,通过主动调整观察方向逐步定位并分割语言描述的目标,从而验证主动感知策略在复杂全景环境中的有效性。
衍生相关工作
APRS数据集衍生了一系列开创性工作,包括主动视觉导航与指代分割的联合学习框架、基于强化学习的视角选择策略网络,以及融合球面几何特征的多尺度全景分割模型。相关研究还延伸至跨模态空间推理方向,涌现出利用Transformer架构编码全景-语言关联的模型,以及模拟人类扫视模式的动态注意力机制。这些工作不仅深化了对主动感知范式的理解,还为后续研究如360°视频流中的实时目标追踪、多智能体协同探索等提供了理论基石与实验基准,推动了计算机视觉与机器人学的交叉创新。
数据集最近研究
最新研究方向
随着具身智能与多模态感知技术的蓬勃发展,APRS数据集开创性地将主动感知范式融入360°全景环境下的指代分割任务,突破了传统静态图像理解的局限。该数据集聚焦于构建可‘主动探索’的视觉智能体,要求模型在连续全景场景中依据自然语言指令动态调整视角以精准定位并分割目标。其四类空间指代表达——涵盖自我中心视角、独有属性描述、他者空间关系及复杂多跳推理——系统性地评估了智能体在全方位环境中的空间推理与主动规划能力。这一方向不仅推动了视觉定位与分割技术的边界,更代表了从被动图像理解走向主动环境交互的重大跃迁,为机器人导航、增强现实及人机协同等前沿应用奠定了坚实的数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务