遇见数据集

Yangyihui/nav-wam-short-ood-interior

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

这是一个用于AWM模型在nav-wam-short-v5家族(包括v3、v5、v5-only、v5p版本)上训练的OOD(分布外)测试集,专门针对室内环境。数据集包含11个新场景,这些场景在训练集或验证集中从未出现过,并使用与v5相同的收集流程(最小路径复杂度为120度,无面向障碍物)。它旨在评估模型在未见过的环境中的导航性能,支持闭环评估,包括元数据文件、视频、轨迹数据和场景资源(如高斯溅射资产和导航网格)。

Out-of-distribution test set for AWM models trained on the nav-wam-short-v5 family (v3 / v5 / v5-only / v5p). The 11 scenes here never appeared in any of those splits (train or val), and use the same v5-style collection pipeline (--min-path-complexity-deg 120, no obstacle-facing).

提供机构:
Yangyihui
搜集汇总
数据集介绍
Yangyihui/nav-wam-short-ood-interior 数据集图片
构建方式
该数据集专为评估具身智能体在视觉语言导航任务中的分布外泛化能力而构建。基于Habitat模拟器,从11个与训练集完全无交集的室内场景中采集数据,确保场景分布严格超出训练范围。采集过程沿用v5风格流水线,使用`--min-path-complexity-deg 120`参数筛选路径,并排除智能体正对障碍物的无效轨迹。每个轨迹片段均标准化存储为视频、轨迹、元数据等文件,并通过高斯泼溅模型和导航网格为闭环评估提供场景资产。
特点
数据集最显著的特征在于其严格的分布外属性——11个场景在已有的训练集和验证集中从未出现,专用于测试模型在全新环境中的零样本适应能力。所有片段均以统一格式组织,元数据架构与nav-wam-short-v5完全一致,便于直接替换测试基准。此外,配套的高斯泼溅渲染资产和导航网格使得在Habitat-GS环境中进行闭环评估成为可能,从而获得更贴近真实部署的性能反馈。
使用方法
使用该数据集时,首先通过HuggingFace CLI下载完整数据包至本地目录。所有测试样本均列于`val.txt`中,可直接将其作为纯测试集加载。元数据文件`meta.jsonl`的行结构与基础数据集一致,无需额外适配。若需进行闭环评估,需指定元数据路径和数据根目录,并调用`habitat_gs_short_val_eval.sh`脚本,配合高斯泼溅场景资产完成端到端导航性能验证。
背景与挑战
背景概述
在具身智能与视觉语言导航(Vision-Language Navigation, VLN)领域,模型在未知环境中的泛化能力是衡量其鲁棒性的核心指标。为此,研究者构建了专用于评估分布外(Out-of-Distribution, OOD)性能的测试集nav-wam-short-ood-interior。该数据集由Yangyihui团队于近期创建,依托Habitat仿真平台,针对基于导航的代理模型(AWM)设计,旨在系统性地检验模型在面对从未在训练或验证阶段出现的室内场景时的表现。数据集包含11个独立场景,均采用统一的复杂路径采集管线(最小路径复杂度120度),并配套高斯泼溅(Gaussian-splat)资产与导航网格,为闭环评估提供了完整的仿真基础设施。该数据集的发布弥补了当前VLN领域缺乏标准化OOD测试基准的空白,对推动具身智能体在真实世界中安全、可靠地部署具有重要学术价值。
当前挑战
该数据集所面临的挑战主要体现在两个方面。首先,在领域问题层面,它聚焦于解决视觉语言导航模型中普遍存在的分布偏移难题——现有模型通常在训练场景内表现优异,但在面对布局、光照、纹理等与训练数据存在显著差异的未知室内环境时,性能急剧下降;该数据集通过严格的场景隔离策略,迫使模型摆脱对特定场景纹理的记忆,转而学习真正的几何与语义泛化能力。其次,在构建过程中,研究者需克服多方面的技术挑战:如何确保11个OOD场景与训练集场景在视觉特征上具有可量化的差异性,同时保持导航任务本身的复杂度一致性;如何通过最小路径复杂度参数(120度)和避障策略生成具有挑战性且可复现的导航轨迹;以及如何将高斯泼溅渲染管线与Habitat仿真引擎高效集成,以支持闭环评估中的实时交互与视觉反馈。这些挑战的妥善解决使得该数据集成为检验具身导航模型OOD鲁棒性的权威基准。
常用场景
经典使用场景
在具身人工智能与视觉语言导航的交叉领域中,nav-wam-short-ood-interior数据集被设计为域外泛化能力的评估基准。该数据集汇聚了11个全新的室内场景,这些场景在训练与验证阶段从未出现过,专门用于检验基于Habitat模拟器的导航模型面对未知环境的鲁棒性与适应性。研究者可借助该数据集中的视频序列、轨迹数据与目标文本,系统性地评估模型在分布偏移条件下的导航决策质量。其封闭循环评估范式尤其适用于验证模型从模拟到真实世界的迁移能力,为开发更可靠的具身导航智能体提供了标准化的测试平台。
实际应用
在实际应用层面,该数据集赋能了多项具身智能技术的落地验证。服务机器人、家庭助手与仓储物流等场景要求导航系统具备处理陌生环境的能力,nav-wam-short-ood-interior提供的11个多样化室内场景恰好模拟了变环境布局的挑战。开发者可利用其高斯泼溅资源与导航网格实现高效的策略迭代,加速从仿真验证到实机部署的转化流程。此外,该数据集的封闭循环评估管道支持对视觉语言导航模型在未知空间中的零样本迁移表现进行标准化测试,为商业级机器人导航软件的质量保障提供了可复现的评价基准。
衍生相关工作
该数据集的发布催生了一系列围绕域外导航泛化能力的创新性研究工作。基于其OOD测试范式,研究者相继提出了注意力权重调制框架与场景不变特征学习策略,旨在增强模型对陌生环境结构的理解。另有工作利用其多模态时序数据训练跨场景目标导向导航器,并通过对比学习分离环境风格与导航路径的潜在表征。该基准还与Habitat仿真生态深度耦合,促使学者开发出适应于具身设置的封闭循环评估指标体系,推动了导航模型在域外场景一致性评测方法论上的规范化发展,形成了以泛化性能为核心的具身导航研究新分支。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务