遇见数据集

ERGeoBench (Embodied Reasoning Geo-localization Benchmark)

收藏
arXiv2026-05-29 更新2026-06-02 收录
官方服务:

资源简介:

ERGeoBench是由北京邮电大学等机构联合构建的首个面向实体化推理与地理定位的多模态大模型诊断基准。该数据集包含全球范围内精心采集的2,207个高分辨率街景全景图,通过可控相机模型转化为以自我为中心的感知环境,支持智能体通过偏航、俯仰和缩放动作主动获取观测视角。数据构建过程融合了大规模地理数据收集与实体化视角合成技术,形成了涵盖单视图、全景视图和实体化视图的三层评估体系。该数据集旨在系统评估多模态大模型在实体化地理定位任务中的四大核心能力——基础感知、空间意识、常识推理与地理定位推理,为解决传统静态地理定位方法在动态交互与证据细化方面的局限性提供标准化测试平台。

ERGeoBench is the first multimodal large language model diagnostic benchmark for embodied reasoning and geolocation, jointly constructed by Beijing University of Posts and Telecommunications and other institutions. This dataset contains 2,207 high-resolution street view panoramas carefully collected worldwide, which are converted into an egocentric perceptual environment via a controllable camera model, enabling AI Agents to actively acquire observation perspectives through yaw, pitch, and zoom movements. The dataset construction process integrates large-scale geographic data collection and embodied view synthesis technology, forming a three-tier evaluation system covering single-view, panoramic view, and embodied view. This dataset aims to systematically evaluate four core capabilities of multimodal large language models in embodied geolocation tasks: basic perception, spatial awareness, commonsense reasoning, and geolocation reasoning, providing a standardized test platform to address the limitations of traditional static geolocation methods in dynamic interaction and evidence refinement.

创建时间:
2026-05-29
搜集汇总
数据集介绍
ERGeoBench (Embodied Reasoning Geo-localization Benchmark) 数据集图片
构建方式
ERGeoBench的构建始于对全球56个国家1000个主要城市的系统采样,通过OpenStreetMap数据加权筛选出街道节点,聚焦于城市中心5公里半径内信息密度高的主干道路。针对每个节点获取高分辨率360度街景全景图,再通过可控摄像机模型将其转化为第一人称视角观察。数据集设计了三种递进的视觉信息条件:固定90度视场角的单视图、提供完整全景图的全景视图,以及允许智能体通过偏航、俯仰和缩放动作序列主动获取观测的具身视图。构建过程严格模拟人类视觉,采用固定焦距渲染以消除鱼眼畸变,并经过人工筛选与质量审核,最终形成包含2207个全球分布全景图的多模态评测基准。
特点
ERGeoBench的核心特点在于其具身化与能力导向的双重设计。首次将现实世界全景图融入具身模拟环境,使智能体像人类一样通过主动转动、俯仰和缩放来逐步积累视觉证据,实现递进式地理定位推理。基准涵盖四项互补的诊断维度:基础感知(建筑、标识、植被、地形、基础设施的五类细粒度识别)、空间意识(偏航估计、深度感知、跨视图物体关系推理)、常识推理(将视觉线索映射为抽象用户需求)以及地理定位推理(综合前三者推断国家、城市及GPS坐标)。这种设计超越了传统单一准确率指标,揭示了定位性能与综合感知推理能力之间的强关联。
使用方法
使用ERGeoBench时,多模态大语言模型被封装为具身智能体,遵循统一的观察-评估-假设更新-行动规划的闭环协议。在单视图设置中,模型仅基于固定视角进行静态推理;全景视图提供完整的场景信息,考察被动理解的上限;具身视图则要求模型通过序列化的偏航、俯仰和缩放动作主动探索,在每一步更新对位置的假设。模型输出需遵循结构化JSON格式,包含五类观察证据、评估分析、当前假设与下一步验证动作。评测采用GLS指标,综合语义分类准确率、多阈值命中率与对数归一化的中位数距离误差,为不同粒度下的定位能力提供标准化排名。
背景与挑战
背景概述
ERGeoBench(具身推理地理定位基准)由北京邮电大学、南洋理工大学等机构的研究人员于2026年提出,旨在填补多模态大语言模型(MLLMs)在具身地理定位评估方面的空白。传统地理定位方法被视作静态识别问题,但人类定位过程天然是序列式的:通过主动调整视角、积累视觉证据并迭代推断位置。为弥合这一鸿沟,该基准利用全球2207张街景全景图,构建了单视角、全景视角与具身视角三种渐进式视觉条件,并将地理定位拆解为基础感知、空间意识、常识推理与地理定位推理四个能力维度。ERGeoBench作为首个系统性评估MLLMs主动感知与跨视角记忆的基准,为构建类人定位智能体提供了标准化诊断框架。
当前挑战
ERGeoBench所解决的领域挑战在于,现有静态地理定位方法无法模拟人类通过主动观察与证据整合实现定位的认知过程,导致模型在视觉复杂场景中难以消解歧义。构建过程中面临三重难题:其一,需从全球56个国家中筛选高信息密度的街景节点,并通过加权评分机制平衡城市中心性与道路显著性;其二,需将360度全景图投影为可控的自我中心视角,同时消除鱼眼畸变以模拟人类视觉;其三,需设计细粒度能力导向的评估框架,覆盖从车道标记到建筑风格的跨类别感知,并确保空间推理任务中视角转换时三维心智地图的一致性维护。这些挑战共同制约着模型在主动探索、跨视角记忆与假设修正方面的表现。
常用场景
经典使用场景
ERGeoBench作为首个系统评估多模态大语言模型在具身地理定位中推理能力的基准,其最经典的使用场景在于衡量智能体在渐进式视觉感知条件下的地理推断表现。该基准通过单视图、全景视图与具身视图三种递进式设定,模拟人类从固定视角逐步转向主动探索的定位过程,要求模型在旋转、俯仰与变焦的动作空间中自主选择信息性视角,并基于历史观测进行假设更新与证据整合。这一设计不仅检验了模型对全球街景的语义理解深度,更揭示了当前模型在细粒度度量定位与跨视角空间一致性方面的核心瓶颈。
衍生相关工作
ERGeoBench的发布催生了多项关于具身地理定位的开拓性工作。在方法层面,研究者借鉴其多视图条件设定与能力导向的诊断框架,开发出基于强化学习的地理定位推理链优化算法,如GRE Suite与GLOBE通过对推理链条进行课程式奖励塑造,显著提升了细粒度坐标回归的精度。在评估层面,后续工作如GAEA通过融合开放街道地图元数据扩展了环境归因的维度,而G3则利用多模态大模型的先验知识实现了高效的自适应定位框架。这些衍生工作共同验证了将具身探索引入地理定位研究的核心价值与广阔前景。
数据集最近研究
最新研究方向
当前,多模态大语言模型在具身地理定位领域的前沿研究正从静态被动识别向主动感知与推理范式演进。ERGeoBench作为首个系统性基准,聚焦于评估模型在单视图、全景视图及具身视图三种渐进式视觉条件下的定位能力,尤其强调通过偏航、俯仰与变焦动作实现主动证据采集与跨视角空间记忆一致性。该基准的提出揭示了现有模型在高层次语义推断上表现尚可,但在细粒度度量定位、空间一致性维护及跨视图推理方面仍面临显著瓶颈。这一研究方向紧密关联具身智能与空间认知的热点事件,强调了精确的地理定位依赖于整合感知、空间推理与常识推断的协同能力,而非孤立的视觉模式匹配,为构建类人的位置感知具身代理提供了关键评测框架与前进方向。
相关研究论文
  • 1
    ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models北京邮电大学·网络与交换技术国家重点实验室; 上海交通大学·材料科学与工程学院; 中国移动研究院; 南洋理工大学·计算与数据科学学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务