遇见数据集

LT-VQA

收藏
arXiv2026-08-19 更新2026-08-21 收录
数据链接:
官方服务:

资源简介:

LT-VQA是由大邱庆北科学技术院构建的多会话场景理解数据集,旨在评估长期目标记忆与时空推理能力。该数据集包含多会话机器人记录、持久身份标注以及时间问答对,数据源自机器人多次访问动态环境,通过实例级3D分割与跨会话身份关联生成。创建过程涉及多会话SLAM对齐、目标检测与跟踪,以及人工标注的时序问答。数据集面向长期机器人操作中的历史遗忘问题,支持纵向目标中心推理与视觉问答,为评估时空记忆框架提供标准化基准。

LT-VQA is a multi-session scene understanding dataset developed by Daegu Gyeongbuk Institute of Science and Technology, with the primary objective of evaluating long-term object memory and spatiotemporal reasoning capabilities. This dataset includes multi-session robot recordings, persistent identity annotations, and temporal question-answer pairs, which are generated through robots' repeated visits to dynamic environments via instance-level 3D segmentation and cross-session identity association. The dataset construction pipeline encompasses multi-session SLAM alignment, object detection and tracking, as well as manual annotation of the temporal question-answer pairs. Targeting the problem of historical forgetting in long-term robotic operations, this dataset supports longitudinal object-centric reasoning and visual question answering, serving as a standardized benchmark for evaluating spatiotemporal memory frameworks.

创建时间:
2026-08-19
原始信息汇总

LT-VQA 数据集详情

数据集简介

LT-VQA 是一个用于评估长期目标中心场景理解的多会话受控数据集。与单会话 VQA 基准不同,LT-VQA 专注于跨会话的目标身份一致性、事件级状态转换标注以及会话索引时序推理,可支持诸如“绿色椅子在所有会话中位于何处?”等跨会话查询。

数据集规模

属性 数值
环境数 3
总会话数 30
问答对数量 80

环境构成

🏠 Lab-S(紧凑室内空间)

  • 会话数:10
  • 帧数/会话:116–159
  • 时长/会话:1.6–2.1 分钟
  • 追踪目标数:10

🏢 Lab-L(较大室内空间)

  • 会话数:10
  • 帧数/会话:115–183
  • 时长/会话:2.6–3.3 分钟
  • 追踪目标数:10

🚗 Parking Lot(室外场景)

  • 会话数:10
  • 帧数/会话:124–195
  • 时长/会话:2.2–3.2 分钟
  • 任务:聚合占用率统计

追踪目标列表

Lab-S:机器狗、蓝色挎包、垃圾桶、白色桌子、手持吸尘器、花卉、咖啡机、白色椅子、灭火器、冰箱

Lab-L:棕色篮子、盆栽、绿色椅子、打印机、机器狗、银色耳机、剪刀、沙发、白板、吸尘器

数据内容与格式

  • 原始数据:每环境包含 RGB 视频和图像、深度及置信度图、相机标定、IMU 和里程计数据
  • 对齐数据:图像、PLY 点云、位姿、时间戳和元数据
  • 标注格式:按会话提供 JSON 格式的物体级事件标签和时序问答对,包含三类标注:
    • 事件标签:如物体移动事件,含源/目标位置和位移量
    • QA-Event:事件级问答对(例如“机器狗在第 6 会话发生了什么?”)
    • QA-Freq:频率统计类问答对(例如“哪个物体移动最频繁?”)

实验结果

方法 Event F1 ↑ QA-Event ↑ QA-Freq ↑ Tokens ↓
Geometric Only 0.630 N/A N/A
Text-Batch 0.460 0.300 0.267 1,992K
VLM-Batch 0.790 0.680 0.333 7,152K
STAR 0.420 0.460 N/A 55,622K
LT-Mem (Qwen2.5-3B) 0.885 0.800 0.567 431K
LT-Mem (Gemini 2.5 Pro) 0.910 0.820 0.600 438K

在 LT-VQA(Lab-S + Lab-L 合并)上,LT-Mem 在所有指标上达到 SOTA 水平。使用 Gemini 2.5 Pro 推理器时,Event F1 达 0.910,QA-Event 达 0.820,QA-Freq 达 0.600,超越最强视觉基线(VLM-Batch),同时 token 消耗减少约 16 倍(438K vs 7,152K)。即使使用轻量级本地 Qwen2.5-3B 推理器,也能超越所有基线。

数据集下载

完整数据集提供下载,包含各环境的原始数据和对齐数据;标注文件以 JSON 格式提供,包含事件级别标注和时序 QA 对。

搜集汇总
数据集介绍
LT-VQA 数据集图片
构建方式
LT-VQA数据集依托多会话SLAM与实例级3D分割技术,在三种环境中(Lab-S、Lab-L室内场景及Parking Lot室外场景)各采集10个会话的RGB视频,通过MASt3R-SLAM进行全局对齐,并利用SAM3提取物体实例,生成跨会话的3D观测。数据集中包含每个物体的持久身份标注、逐会话事件标签(如APPEAR、MOVE)以及80对时间问答对,确保覆盖物体状态变化的历史轨迹。
特点
LT-VQA的核心特点在于其提供了跨会话的物体身份追踪与事件级标注,弥补了现有数据集在时间维度上的不足。它明确区分了不同类型的物体状态变化(如移动、消失、重现),并支持复合查询(如轨迹跟踪、波动性统计),同时涵盖室内外场景,为评估长期场景理解中的时间推理能力提供了标准化基准。
使用方法
使用时,LT-VQA可用于训练和评估模型的多会话物体追踪与时间问答能力。利用全局对齐的3D地图,模型需执行跨会话物体重识别,并回答基于事件日志的查询。评估指标包括事件F1分数、问答精确匹配率及频率查询准确率,同时需控制LLM调用等推理成本,以验证结构化记忆架构的有效性。
背景与挑战
背景概述
LT-VQA数据集由韩国DGIST机器人工程系的Yumin Lee、Hyoseok Ju和Giseop Kim于2026年提出,旨在应对长期机器人运行中场景理解的时间遗忘问题。该数据集通过多会话SLAM提供空间对齐的实例级3D感知,并引入波动感知的时序记忆框架LT-Mem,支持跨会话的持久身份追踪和时序问答。LT-VQA包含两个室内环境(Lab-S、Lab-L)和一个室外停车场环境,每个环境10个会话,提供事件级标注、持久身份标注和80对时序问答对,填补了现有数据集在长期对象中心推理方面的空白,对自动化和机器人领域具有重要推动作用。
当前挑战
LT-VQA面临的核心挑战在于多会话环境中对象状态的动态演变与身份保持之间的矛盾。现有系统往往通过覆盖或删除旧状态来维持地图更新,导致时间遗忘,无法回答诸如“绿色椅子跨会话位置”的时序查询。数据集构建中,跨会话对象关联需应对遮挡、对齐噪声和外观相似性,实现持久身份匹配极为困难。此外,事件级标注(如移动、消失、重现)需要精细的多时间对齐,资源消耗大,且涵盖波动性差异大的对象,要求算法能自适应调整更新策略,这远超单一阈值方法的能力,对语义记忆和时序推理提出了更高要求。
常用场景
经典使用场景
LT-VQA数据集的核心应用场景聚焦于长期场景理解中的时序视觉问答,尤其在机器人多次回访同一环境时,需对物体状态变化进行跨会话的推理与应答。该数据集通过提供多会话的全局对齐点云、持续物体实例身份标注以及基于会话索引的时序问答对,支持诸如“绿色椅子在全部会话中曾位于何处”或“机器狗在第6次会话中发生了什么”等查询。这些查询要求系统不仅理解当前场景,还需回溯历史事件,从而推动对物体级时空记忆建模的研究。
实际应用
在实际应用中,LT-VQA支撑长期自主机器人的环境监控与导航服务。例如,在仓库或家庭环境中,机器人需定位移动物体、识别短期消失或重新出现的物品,并基于历史统计回答“何时停车位最紧张”或“打印机是否适合作为导航地标”等实用问题。该数据集通过模拟真实场景中的多会话变化,赋能机器人执行精准的物体追踪、空间统计和决策辅助,从而提升长期部署中的可靠性与适应性,尤其适用于服务机器人、智能安防及动态环境下的物流管理。
衍生相关工作
LT-VQA的发布催生了多项衍生研究,主要围绕三维场景图构建、跨会话物体重识别以及波动性感知记忆压缩。基于该数据集,研究者进一步探索了轻量级视觉语言模型在时序推理中的高效融合,以及利用结构化事件日志替代原始视频流以减少推理成本。此外,其提出的Tri-Memory概念启发了分层记忆架构在视觉问答、场景理解及机器人导航中的应用,推动了从静态地图到动态语义记忆的范式转变,并为后续大规模多会话基准的建立奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务