遇见数据集

GangnamLoop

收藏
arXiv2026-06-16 更新2026-06-17 收录
官方服务:

资源简介:

GangnamLoop是一个新颖且实用的多行程户外空间问答基准数据集,由RGA Inc.通过部署真实四足机器人在公共街道上收集而成,并遵循匿名化政策。该数据集包含机器人在不同室外条件下重复访问相同地点的轨迹数据,同时结合了机器人的低视角与人类主人的视角,数据规模涵盖长时程自我中心视频和里程计信息,用于构建可搜索的记忆表示。其创建过程涉及真实机器人部署、多视角采集以及严格的隐私处理,旨在评估服务机器人在重访处理和跨域鲁棒性方面的性能,解决空间定位与导航中的实际挑战,推动开源模型在机器人领域的应用。

GangnamLoop is a novel and practical benchmark dataset for multi-trip outdoor spatial question answering. It was collected by RGA Inc. through deploying real quadruped robots on public streets, in compliance with anonymization policies. This dataset contains trajectory data where the robot repeatedly visits the same locations under varying outdoor conditions, combining both the robot's egocentric low-angle perspective and its human owner's perspective. It includes long-duration egocentric videos and odometry information, enabling the construction of searchable memory representations. Its creation involves real robot deployment, multi-perspective data collection, and rigorous privacy processing. It is designed to evaluate the performance of service robots in revisit handling and cross-domain robustness, address practical challenges in spatial localization and navigation, and promote the application of open-source models in the robotics field.

提供机构:
RGA Inc.
创建时间:
2026-06-16
原始信息汇总

数据集概述:BinTrack 与 GangnamLoop 基准

该仓库提供了 BinTrack 的官方实现以及 GangnamLoop 基准数据集。

BinTrack 简介

  • 定义:一个完全开源的空间问答(Spatial Question Answering, SQA) 代理,专为服务机器人设计。
  • 核心方法:通过对轨迹段执行二分搜索来定位查询中指定的目标位置。
  • 关键特性
    • 完全开源,推理时无需任何闭源API。
    • 所有组件均可复现,不依赖外部商业服务。
  • 性能表现
    • SpaceLocQA 基准上,使用开源模型,BinTrack 的总体成功率达 67.4%(@15米误差容限,270个查询),比所有开源基线高出最多 22.8%,并在最难的全局类别上与闭源方法持平(62.2%)。
    • GangnamLoop 基准上,总体成功率为 45.3%(@15米误差容限,360个查询),远超开源基线(15.6% 和 18.0%)。

核心技术组件

  • 多视角记忆(Multi-view memory):每个路段以三种方式(全视图/中心视图/细节视图)进行描述,便于检索匹配。
  • 二分跟踪(Binary Tracking):一种视觉-语言模型(VLM)引导的二分搜索算法,在从查询中识别出的两个锚点之间,反复收缩搜索区间,直至定位到目标段。
  • 分离式架构:规划代理(纯文本32B模型)与验证器(7B视觉-语言模型)分离,避免单一模型产生投票计数幻觉。

环境与模型

角色 使用的模型
描述器(构建记忆) Qwen2.5-VL-7B-Instruct
验证器(4视角集成) Qwen2.5-VL-7B-Instruct(共享)
规划代理 Qwen2.5-32B-Instruct-AWQ
文本编码器 mxbai-embed-large-v1
向量数据库 Milvus (Lite)

GangnamLoop 基准数据集

  • 构建方式:由一台四足机器人在首尔江南区的公共街道上录制的多行程(multi-trip)户外基准。
  • 数据规模
    • 录制次数:8次
    • 总查询数:360个
    • 昼夜配对:4组
    • 视角数量:2个(机器人和人类所有者)
    • 总录制时长:221分钟
    • RGB帧数:383,800帧
  • 录制路线:4条往返路线(E→A→E,E→B→E,E→C→E,E→D→E),每条路线在昼夜不同条件下各录制一次。
  • 共享坐标系:所有8次录制共享一个SLAM坐标系。
  • 评价设定:相同目的地但不同时间(白天/夜晚)的录制形成跨域评估集。
  • 发布状态:即将在 Hugging Face 上发布。
搜集汇总
数据集介绍
GangnamLoop 数据集图片
构建方式
GangnamLoop数据集由一台真实的Unitree Go2四足机器人在城市公共街道上采集而成,搭载Intel RealSense D455深度相机、Livox MID-360激光雷达及内置IMU,采用基于Point-LIO的激光-惯性SLAM管道估计每帧位姿。数据集包含8次往返记录,每次从固定办公室位置(E)出发,前往四个不同地铁站之一(A–D)并返回,每条路线分别在白天和夜间各采集一次,形成四对昼夜配对。机器人以约0.8米的低视角录制视频,同时部分记录中人类佩戴头戴相机同步采集第一人称视角,从而提供双视点数据。所有轨迹均注册到同一SLAM地图上,使得同一地点在不同条件下的回访可直接比较。数据集共包含383,800帧RGB图像、约221分钟的视频,以及360个经过双人交叉验证的空间查询问题。
特点
GangnamLoop的核心特点在于其多场景回访设计和实际部署逼真度。它首次在空间问答基准中实现了同一地点的多次回访,并覆盖昼夜光照变化等环境域迁移,直接考验系统对环境变化的鲁棒性。机器人低视角(约0.8米)与人类平视视角(1.5–1.9米)的双视点配对,模拟了真实服务机器人与用户之间的视角错配问题,这是现有数据集未能充分涵盖的关键因素。此外,数据集包含真实的街头行人场景,并实施了面部与车牌匿名化处理,既保证了隐私合规,又保留了真实城市环境的复杂度。其导航路线涵盖商业街、窄巷和林荫大道等多种城市地形,为评估空间问答系统在实际部署中的泛化能力提供了严苛而真实的测试平台。
使用方法
GangnamLoop主要用于评估和训练空间问答系统在真实服务机器人场景下的性能。使用者可将机器人的第一人称视频与位姿数据构建为可检索的记忆库,每条轨迹被分割为1.5秒的固定时长片段,每个片段通过开源视觉语言模型生成全景、中心、细节三种视角的描述文本并编码为向量索引。使用时,系统接收自然语言查询(如'从办公室到地铁站的路上哪里有咖啡店?'),通过语义检索和Binary Tracking算法在有序的轨迹片段区间内进行结构化搜索,最终输出目标地点的二维度量坐标。数据集提供了360个涵盖基础、局部和全局三类查询的问题集,评估指标为预测坐标与真值坐标欧氏距离小于15米的成功率。所有实验仅使用开源模型,保证了完全的可复现性。
背景与挑战
背景概述
GangnamLoop数据集由韩国RGA Inc.的研究团队于2026年创建,旨在解决服务机器人在室外长距离导航中的空间问答问题。该数据集基于真实四足机器人在首尔江南区公共街道上采集的多趟往返轨迹,覆盖白天与夜晚的不同光照条件,并同时提供机器人的低视角(约0.8米)与人类佩戴摄像头的平视视角(约1.5-1.9米)。核心研究问题在于如何让机器人利用开放源码的视觉语言模型,在缺乏稳定网络连接与高昂API调用成本的情况下,准确回答诸如“回家路上哪里有干洗店?”之类的路径约束空间查询。GangnamLoop首次将多趟回访、跨域光照变化与视角不匹配纳入空间问答基准,推动了服务机器人从封闭源码模型向完全开放源码、可重现的自主导航方向的发展。
当前挑战
GangnamLoop所解决的领域挑战在于空间问答中的全局路径约束查询——要求机器人从长距离ego-centric视频中定位两个地标之间的目标,这需要融合语义推理、时间顺序与空间连续性,而依赖GPT-4o等闭源模型的方法在应用于开放源码模型时准确率骤降(全局类别下降29.6%)。构建过程中面临三重困难:一是室外多趟采集需同步机器人LiDAR-惯性SLAM坐标系与人类视角,确保跨天、跨光照的轨迹对齐;二是低视角机器人在密集商业街区录得383,800帧视频,需在匿名化行人面部与车牌的隐私约束下,为8条时长3-45分钟的往返路线生成360个覆盖基本、局部与全局三类查询的标注坐标;三是开放源码的7B级视觉语言模型在场景描述、小目标识别及韩文招牌阅读上的能力不足,迫使研究者设计多视角记忆与二分搜索算法(BinTrack)来弥补性能差距。
常用场景
经典使用场景
GangnamLoop数据集的核心应用在于为服务于真实街道环境的四足机器人提供多行程、跨时段的空间问答评测基准。该数据集通过在同一城市公共路段进行昼夜重复采集,构建了包含机器人低视角与人类操作员头戴视角的双视点记忆库,专门用于评估机器人在长程自主导航任务中,基于自然语言空间查询(如“返回途中何处有干洗店”)输出公制坐标的能力。其经典使用场景聚焦于服务机器人在日常运维路线中,面对光照变化、视角差异及人流量动态场景时,如何实现精准、鲁棒的空间定位与路径理解。
衍生相关工作
GangnamLoop数据集的发布催生了一系列围绕开放源码空间问答系统优化的衍生工作。其中最显著的即是随数据集一同提出的BinTrack框架,该框架引入基于轨迹时序有序性的二分追踪算法,替代了以往依赖闭源大语言模型进行图搜索的推理范式,使得全局路径约束查询的准确率在开放源码约束下提升高达22.8%。后续研究工作可围绕三个方向展开:一是改进多视图记忆表征以提升小目标与遮挡场景下的检索精度;二是探索鲁棒的跨行程轨迹对齐策略,实现多趟采集间的知识迁移;三是设计轻量化的在线记忆构建流水线,降低内存构建延迟,推动方法向实时部署迈进。
数据集最近研究
最新研究方向
在当前空间问答与机器人导航的前沿研究中,GangnamLoop数据集应运而生,旨在突破现有数据集仅覆盖单次室内或校园场景的局限。该数据集聚焦于服务机器人在真实城市街道中重复执行多趟任务时的环境理解难题,特别关注照明变化、视角差异(机器人低视角与人类平视)以及行人动态等复杂因素带来的域偏移挑战。通过部署真实的四足机器人在公共街道上采集日夜成对的多趟轨迹,并配合同步的人类第一人称视角,GangnamLoop为评估机器人路径约束下的全局推理、重访识别与跨域鲁棒性提供了首个实用的室外基准。其发布标志着空间问答研究从受控环境向真实服务机器人部署场景的关键迈进,有力推动了开源模型在具身空间推理与长时间导航记忆构建方面的发展。
相关研究论文
  • 1
    Binary Tracking for Spatial QA and Navigation with Open Vision-Language ModelsRGA Inc. · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务