遇见数据集

FINDINGDORY

收藏
arXiv2025-06-19 更新2025-11-28 收录
官方服务:

资源简介:

FINDINGDORY是一个用于评估具身智能体长期记忆能力的新基准,它包含60个多样化的导航任务,这些任务要求智能体在高度逼真的室内环境中进行持续参与和情境意识。数据集由两个阶段组成:经验收集阶段和交互阶段。在经验收集阶段,智能体与不同的物体进行交互,并在交互阶段根据这些历史经验完成任务。数据集使用Habitat模拟器构建,包括107个训练场景和30个验证场景,共有82,174个训练任务实例和5,876个验证任务实例。该数据集旨在解决具身智能体在长期决策中如何有效地整合和利用长期记忆的问题。

FINDINGDORY is a novel benchmark for evaluating the long-term memory capabilities of embodied AI agents. It includes 60 diverse navigation tasks that require agents to engage continuously and maintain situational awareness within highly realistic indoor environments. The dataset consists of two phases: an experience collection phase and an interaction phase. During the experience collection phase, agents interact with various objects, and in the interaction phase, they complete tasks based on these historical experiences. Constructed using the Habitat simulator, the dataset comprises 107 training scenes and 30 validation scenes, with a total of 82,174 training task instances and 5,876 validation task instances. This benchmark aims to address the problem of how embodied AI agents effectively integrate and utilize long-term memory during long-term decision-making.

创建时间:
2025-06-19
搜集汇总
数据集介绍
FINDINGDORY 数据集图片
构建方式
FINDINGDORY基准采用两阶段构建流程,首先在Habitat模拟器中利用脚本化的Oracle智能体自动执行物体拾取与放置操作,收集包含丰富交互日志的长序列视觉经验(涵盖400至3500帧、2至11次交互),随后通过随机采样场景特定实体生成模板化任务指令,并利用PDDL规范系统实现自动化验证,最终构建出涵盖60种任务的6,000余个评估实例。
特点
该基准具备多项独特优势:基于HSSD数据集的高逼真度室内场景确保了视觉复杂性;任务设计横跨空间、时间与语义多个记忆维度,涵盖物体回忆、交互顺序、持续时间追踪等类型,有效抑制启发式捷径;通过可编程扩展机制允许任务难度随交互次数增加而线性增长,为评估长期记忆与多跳推理能力提供了规模化且可复现的测试平台。
使用方法
使用方法上,采用分层架构进行评估:顶层视觉语言模型(如Gemini、GPT-4o、Qwen)接收完整交互视频并预测目标帧索引,底层导航策略(图像目标导航或建图规划)将所选帧转换为具体动作执行。评估体系包含高级与低级成功率及路径长度加权指标,并引入松弛度量以解耦语义检索与空间定位的失败模式,为记忆增强型智能体的研发提供诊断性反馈。
背景与挑战
背景概述
FINDINGDORY由佐治亚理工学院与牛津大学的研究人员于2025年共同创建,旨在系统评估具身智能体在长期任务中的记忆能力。该基准聚焦于一个核心研究问题:当前视觉大模型能否在高度真实感的仿真环境中,通过对过往交互经验的精细推理来完成导航与操作指令。与仅关注图像分类或视觉问答的经典基准不同,FINDINGDORY填补了具身智能领域中长时间跨度记忆评估的空白。它利用Habitat模拟器构建了包含60种多样化任务的挑战集,任务要求智能体在融合空间、时间与语义维度的基础上进行多跳推理。该数据集的诞生为后续研究提供了可扩展的评估框架,推动了具身智能体在持续环境感知与决策记忆方面的进步。
当前挑战
FINDINGDORY所面对的挑战具有双重性。首先,在领域问题层面,当前视觉大模型在处理超过数百张图像的长序列输入时表现欠佳,难以有效融合分散在长时间跨度内的关键信息,尤其在需要追踪交互顺序、运动轨迹及细粒度属性的时空推理任务中暴露出明显局限。其次,在构建过程中,研究团队需解决两大难题:一是如何在仿真环境中生成包含自然交互行为的经验序列,确保对象拾取与放置动作的物理合理性;二是如何设计能完全隔离探索不确定性因素的任务模板,确保智能体的成功仅取决于其记忆能力而非常规感知或试探策略。这些挑战促使FINDINGDORY通过程序化生成的动态场景与层次化验证机制来确保评估的严谨与可扩展性。
常用场景
经典使用场景
FINDINGDORY数据集主要应用于评估具身智能体在室内环境中长时记忆能力的基准测试。该数据集通过设计两阶段任务——经验收集阶段与交互阶段,要求智能体利用先前交互的历史记录(包括导航、抓取和放置等操作日志)完成复杂的导航与目标检索任务。经典使用场景包括:根据记忆回溯特定对象的空间位置、按照时间顺序重新访问交互过的物体、识别未被操作过的物品以及基于空间关系推理最近或最远的交互目标。这些任务不仅考验智能体对历史经验的准确回忆,更强调其在动态场景下进行多跳推理与行动决策的能力。
衍生相关工作
FINDINGDORY数据集的提出催生了一系列相关研究工作,包括基于层次化架构的视觉-语言模型与导航策略融合方法(如MobilityVLA、ReMEmbR),以及通过非参数化记忆树(如Embodied-RAG)或流式字幕累积策略来增强长视频理解的方案。此外,该基准为监督微调范式提供了训练数据,推动了Qwen2.5-VL等开源模型在时序教学信号下的性能提升。相关工作还涉及空间认知记忆增强的探索,以及利用显式地图与拓扑图进行路径规划的策略。这些衍生工作共同推动了多模态具身智能体中记忆检索与动作执行的端到端学习发展。
数据集最近研究
最新研究方向
基于FINDINGDORY基准,当前研究前沿聚焦于评估具身智能体在高度真实室内环境中的长期记忆能力,尤其是视觉-语言模型(VLM)在处理大规模时序观测和复杂时空推理时的局限性。该基准通过构造需回忆先前交互经验的导航与操作任务,揭示了现有模型在空间关系推理、多目标追踪及分层策略中的显著短板,推动了记忆增强型策略学习与长上下文感知模型的发展,对实现类人记忆机制在机器人自主决策中的集成具有深远影响。
相关研究论文
  • 1
    通过乔治亚理工学院, 牛津大学 · 2025年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务