遇见数据集

IntentionNav

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

IntentionNav是一个用于室内场景中意图驱动物体导航的基准测试数据集,包含500个项目。其核心特点是不直接命名目标物体类别,而是通过人类意图间接描述目标物体,要求智能体理解意图并导航到相应物体。数据来源于176个Kujiale公寓场景,涵盖64个目标物体类别。每个项目提供4种不同风格的英语意图描述变体(正式、自然、随意、情感),共计2000条英语指令。图像数据为1024x1024分辨率的PNG格式,使用Isaac Sim渲染。每个项目指向场景中唯一一个目标物体实例(该物体类别在场景中仅有一个物理实例)。数据集包含完整的字段定义,如唯一选择ID、场景ID、目标类别、目标代表实例、图像相对路径、四种意图文本、包含目标接地和风格区分度得分的元数据、主要意图模式分类(事件脚本、内在状态、物理状态、功能可供性)以及房间信息。此外,数据集还提供了用于评估的固定500个导航情节规格(包含起始位置、目标位置、房间、距离等),以及参考评估资源(包括参考代理记录、情节工件、评估代码快照和可复现性元数据)。该数据集主要用于具身AI代理和基于视觉语言模型的导航系统的基准评估。

IntentionNav is a benchmark dataset for intention-driven object navigation in indoor scenes, consisting of 500 items. Its core characteristic is that it does not directly name target object categories, but instead indirectly describes target objects via human intent, requiring intelligent agents to comprehend the intent and navigate to the corresponding objects. The dataset is sourced from 176 Kujiale apartment scenes, covering 64 target object categories. Each item provides four stylistically distinct English intent description variants (formal, natural, casual, emotional), totaling 2000 English instructions. The image data is in PNG format with a resolution of 1024x1024, rendered using Isaac Sim. Each item corresponds to exactly one target object instance in the scene (there is only one physical instance of that object category within the scene). The dataset includes complete field definitions, such as unique selection ID, scene ID, target category, target representative instance, relative image path, four types of intent texts, metadata containing target grounding and style distinctiveness scores, main intent pattern classification (event script, intrinsic state, physical state, affordance), as well as room information. Additionally, the dataset provides fixed 500 navigation episode specifications for evaluation (including start position, target position, room, distance, etc.), alongside reference evaluation resources (including reference agent recordings, episode artifacts, evaluation code snapshots and reproducibility metadata). This dataset is primarily used for benchmark evaluation of embodied AI agents and vision-language model-based navigation systems.

创建时间:
2026-07-26
原始信息汇总

数据集概述

IntentionNav 是一个用于意图驱动的室内物体导航的基准数据集,包含 500 个样本。每个样本通过人类意图间接描述目标物体,而非直接命名物体类别。

关键数据规模

  • 样本数量: 500 个
  • 场景数量: 176 个 Kujiale 公寓场景
  • 目标类别: 64 种
  • 指令变体: 每个样本 4 种,共 2000 条英文指令
  • 图片格式: 1024 x 1024 PNG,使用 Isaac Sim 渲染
  • 目标策略: 每个样本指向一个 USD 物体实例,该实例在场景中唯一存在

意图模式分布

主要意图模式计数如下:

  • 事件脚本 (event-script): 202 个
  • 内部状态 (inner-state): 167 个
  • 物理状态 (physical-state): 72 个
  • 功能 (affordance): 59 个

数据集结构

README.md croissant.json selected_500_intents.jsonl episodes.jsonl <scene_id>/ intents.json manifest.json photos/ *.png

每个样本包含的字段

  • selection_id: 唯一 ID,例如 SEL_001
  • scene_id: 场景 ID,例如 kujiale_XXXX
  • target_category: 真实目标物体类别
  • target_representative: 具体物体实例
  • photo: 图片相对路径
  • formal_en / natural_en / casual_en / emotional_en: 4 种英文意图变体
  • _refine_meta: 可选的改写/判断元数据,包含目标定位(tg)和风格区分度(sd)分数
  • _intent_mode: 主要诊断模式(EVENT_SCRIPT、INNER_STATE、PHYSICAL_STATE 或 AFFORDANCE)
  • room / room_type: 目标所在房间

固定导航片段

episodes.jsonl 文件包含用于评估的固定 500 个导航片段规范。每行通过 selection_id 与意图记录关联,包含确切的 scene_id、目标物体及位置、起始位置及四元数、起始/目标房间以及测地距离/欧几里得距离。

参考评估资源

reference_results/ 目录提供参考智能体记录、保留的片段工件、评估代码快照以及可重复性元数据,用于审计和重演报告的基准分数。

目录结构如下:

reference_results/ logs/ episode_artifacts/ evaluation_code/ reproducibility/ MANIFEST.json SHA256SUMS

数据集用途

该数据集旨在用于具身 AI 智能体和基于 VLM 的导航系统的基准评估。数据集中不包含人类主体或个人身份信息。当前版本包含模型生成的英文意图和自动 VLM 判断元数据,用户应将这些标注视为基准标签,而非自然收集的人类话语。

搜集汇总
数据集介绍
IntentionNav 数据集图片
构建方式
IntentionNav数据集的构建基于意图驱动的目标导航任务,旨在通过人类意图而非直接命名物体类别来间接描述目标对象。该数据集包含500个精心设计的导航条目,覆盖176个Kujiale公寓场景,共64个目标类别。每个条目对应场景中唯一物理实例的USD物体对象,并通过四种英语意图变体(正式语、自然语、随意语、情感语)进行描述。数据集使用Isaac Sim渲染为1024x1024像素的PNG图像,并包含固定的导航依据文件(episodes.jsonl),以确保评估的一致性。构建过程中,目标选择策略确保每个类别在场景中仅有一个实例,从而消除歧义。
特点
IntentionNav数据集的显著特点在于其意图模式的多样化,涵盖事件脚本(202条)、内部状态(167条)、物理状态(72条)和可供性(59条)四种主要类型,为评估具身智能体的意图理解能力提供了丰富场景。每个条目均包含目标接地(target-grounding)和风格可区分性(style-distinguishability)评分,以辅助诊断意图表达的质量。数据集规模虽小(n<1K),但通过固定导航依据和参考评估资源(如日志、评估代码快照)确保了结果的可复现性,同时避免了人类主观偏见,因为所有意图均由模型生成并经自动化验证。
使用方法
使用IntentionNav数据集时,用户可加载selected_500_intents.jsonl文件获取意图记录,并通过episodes.jsonl文件获取固定的导航依据。图像路径以场景为基准,例如对于scene_id为'kujiale_0262'且photo为'surface_photos/21_x.png'的条目,实际图像位于kujiale_0262/photos/21_x.png。数据集主要用于具身智能体和视觉语言导航系统的基准评估,用户需注意其注释为基准标签而非自然人类话语。参考评估资源目录(reference_results/)提供了可复现性元数据,便于审计和重放基准测试得分。代码示例展示了如何加载条目并提取导航信息,简化了集成过程。
背景与挑战
背景概述
IntentionNav数据集于2024年由多机构研究团队合作构建,专注于具身智能体在室内场景中的意图驱动目标导航任务。该数据集包含500个精心设计的导航实例,覆盖176个Kujiale公寓场景和64个目标类别,每个实例通过人类意图间接描述目标物体而非直接命名类别。与传统目标导航基准不同,IntentionNav强调理解人类行为意图(如事件脚本、内在状态、物理状态和可供性)的能力,推动了视觉语言模型在复杂人机交互场景中的发展。数据集基于NVIDIA Isaac Sim渲染1024×1024像素的逼真图像,并提供四种风格的英文指令变体(正式、自然、随意、情感),共计2000条指令。通过固定导航轨迹和严格的评估协议,IntentionNav为具身AI领域提供了一个标准化的、可复现的基准测试平台,显著提升了意图理解与空间推理结合的评估水平。
当前挑战
IntentionNav面临的领域挑战在于,传统目标导航通常基于显式物体类别名称(如“找到椅子”),而意图驱动导航要求智能体从模糊、隐式的自然语言描述(如“我累了想休息”)中推断目标物体(如沙发),这需要深度理解人类行为意图与场景上下文之间的关联。构建过程中,研究团队需解决意图多样性生成问题,设计四种意图模态(事件脚本、内在状态、物理状态、可供性)以确保覆盖真实场景中的复杂表达;同时需精确控制每个场景中目标类别的唯一性,避免歧义。此外,渲染大规模高质量图像、确保不同风格指令的可区分性(style-distinguishability),以及固定500个可复现的导航轨迹以支持公平评估,均对数据质量和一致性提出了严格挑战。
常用场景
经典使用场景
在具身智能与视觉语言导航的交汇领域,IntentionNav数据集为意图驱动的室内物体导航任务提供了标杆性评估基准。其核心使用场景在于,智能体需依据蕴含人类意图的间接描述(如“准备一杯咖啡时需要的东西”而非直接指定“咖啡杯”),在未知室内环境中自主定位目标物体。数据集包含500个精心设计的导航任务,覆盖176套Kujiale公寓场景中的64类目标物体,每项任务配备四种语言变体(正式、自然、随意、情感化),旨在检验导航系统对多样化意图表达的理解与泛化能力。这一设定突破了传统物体导航对显式类别标签的依赖,推动具身智能体从视觉感知向意图推理的深层认知能力跃迁。
实际应用
在实际应用维度,IntentionNav的技术路线可直接服务于家庭服务机器人、辅助生活系统及智能家居交互界面。例如,照顾老年人的机器人可依据“将病人睡前需要的物品拿来”这类模糊指令,在复杂家庭环境中精准定位水杯、药品或毛毯等目标;智能家居系统可解析“孩子放学后可能需要的东西”这种蕴含时间关联的意图,主动调度清洁或照明设备。数据集中的导航叙事规范(包括固定起点、终点坐标及测地距离)为工业级部署提供了可复现的测试框架,降低了从实验室仿真到实际部署的迁移成本。其基于Isaac Sim渲染的高保真图像和标准化评估管道,亦为物流仓储中无人车的语义拣选任务和商场导引机器人的动态路径规划提供了直接的技术支撑。
衍生相关工作
IntentionNav的发布催生了多个研究分支的蓬勃进展。在算法层面,研究者基于其意图模式标签开发了目标导向的语义记忆模块,使智能体能够通过语言-视觉联合嵌入实现跨场景知识迁移。在评测方法论上,数据集中固定的500条导航叙事(含SHA-256校验)被广泛采纳为标杆测试集,推动了意图导向导航领域标准化评估框架的建立,例如后续工作开始关注指令忠实度与意图对齐度的量化指标。此外,该数据集与3D场景图、分布外泛化等方向的交叉研究涌现出若干经典工作,包括结合大语言模型进行常识推理的导航规划器、以及利用对比学习解耦意图与空间线索的多模态训练范式。其包含的四种语言变体更是催生了风格鲁棒的导航模型研究,成为检验语义理解系统在真实交互中适应性的重要资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务