遇见数据集

Yangyihui/nav-wam-short-v6-textfix

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

nav-wam-short v6 (VLM改进文本)是一个消融数据集,专注于文本指令质量。它基于nav-wam-short-v5的收集流程(使用collect_goal_point_segments.py --min-path-complexity-deg 120,无面向障碍物),但进行了以下改进:切换VLM模型从gemini-3.1-flash-lite-preview(已停用)到gemini-2.5-flash(更强);增加了VLM调用的预算以支持完整推理和JSON输出;当VLM验证接受重写时,即使重写删除了数据集标签令牌,也会使用重写(以捕捉InteriorGS的错误标签,例如将发廊的“沙发”实际识别为沙龙椅);当VLM拒绝并返回visible=<名词>时,模板会将数据集标签替换为VLM可见的名词(例如,wardrobe -> cabinet)。该数据集包含214个片段,其中52%的片段获得了VLM改进的文本,相比v5的约30%有所提升。数据集仅包含验证集(val.txt),用于文本质量比较的纯测试集。

nav-wam-short v6 (VLM-enhanced text) is an ablation dataset focused on text instruction quality. It follows the data collection pipeline of nav-wam-short-v5 (using `collect_goal_point_segments.py --min-path-complexity-deg 120`, no obstacle-facing constraints), with the following improvements: 1. Switched the VLM model from gemini-3.1-flash-lite-preview (now discontinued) to gemini-2.5-flash, which offers stronger performance; 2. Increased the VLM inference budget to support full reasoning and JSON output; 3. When the VLM validation accepts a rewritten text, the revised version will be used even if it deletes dataset label tokens, to fix mislabeling issues in InteriorGS (e.g., identifying the "sofa" in a hair salon as a salon chair); 4. When the VLM rejects the original text and returns `visible=<noun>`, the template will replace the dataset label with the noun recognized by the VLM (e.g., wardrobe -> cabinet). This dataset contains 214 segments, 52% of which have VLM-enhanced text, an improvement over the ~30% rate in version v5. The dataset only includes the validation set (val.txt) as a pure test set for text quality comparison.

提供机构:
Yangyihui
搜集汇总
数据集介绍
Yangyihui/nav-wam-short-v6-textfix 数据集图片
构建方式
该数据集旨在提升机器人导航任务中的文本指令质量,基于nav-wam-short-v5的采集流程构建,但引入了更强的视觉语言模型(VLM)进行文本优化。采集过程通过`collect_goal_point_segments.py`脚本执行,设定最小路径复杂度为120度,并排除面向障碍物的轨迹。相较于v5版本,本数据集将VLM从失效的`gemini-3.1-flash-lite-preview`升级为更强大的`gemini-2.5-flash`,并增加了推理预算以确保完整的思维链与JSON输出。当VLM验证接受文本重写时,即使重写结果丢弃了原始标签词也予以采用,从而纠正InteriorGS的错误标注(如将美发沙龙的“沙发”修正为“美发椅”)。若VLM拒绝并返回可见名词,则用该名词替换数据集标签(如将“衣柜”替换为“橱柜”)。最终,约52%的片段(共214条)获得了VLM改进的文本,相较于v5的30%有显著提升。
特点
该数据集的显著特点在于其对文本质量的专注,而非数据规模或多样性。所有214条片段均划分至验证集,作为纯粹的测试基准,用于对比不同文本质量的影响。文本质量分布清晰展示了VLM的干预效果:32.2%的片段经历了完整的VLM重写以消除歧义,20.1%通过可见名词替换修正了标签错误,30.8%被VLM判定为无需修改,仅16.8%因解析失败回退至模板。这种分层标注使研究者能够精确评估文本精细化对导航性能的影响。此外,数据集保留了完整的闭环评估配套资源,包括高斯溅射场景资产、导航网格和场景数据集配置,支持基于Habitat模拟器的闭环导航评测。唯一的不同在于文本指令的来源与质量,为消融实验提供了理想环境。
使用方法
数据集可通过Hugging Face CLI便捷下载,使用`huggingface-cli download --repo-type dataset Yangyihui/nav-wam-short-v6-textfix --local-dir /path/to/v6_textfix`命令将数据存储至本地目录。随后,在进行闭环评估时,需将`DATA_ROOT`和`GS_DATASET_ROOT`均指向该同一目录,并配合`META_PATH`指定`meta.jsonl`的路径、`SPLIT_FILE`指向`val.txt`,以及`MODEL_PATH`指向待评估的模型检查点,执行提供的评估脚本`habitat_gs_short_val_eval.sh`。由于数据集仅有验证集,它专门用于对比测试,无需考虑训练集划分。这种设计使得研究人员能够直接专注于文本质量改进对最终导航性能的量化影响,简化了实验流程。
背景与挑战
背景概述
具身智能导航领域长期受困于自然语言指令与视觉环境间的语义鸿沟,传统数据集中的文本标注常因人工标注成本高昂或自动模板机械化而引入噪声。在此背景下,上海交通大学杨一辉团队于2025年发布了nav-wam-short-v6-textfix数据集,该数据集是nav-wam-short系列的消融版本,核心目标聚焦于提升导航指令中文本描述的质量与语义准确性。研究依托Habitat仿真平台,采用视觉语言模型(VLM)对原始指令进行系统性改写与审核:当模型确认原指令存在歧义时,直接采纳VLM的精炼表述;若检测到物体标签错误(如将‘衣柜’误标为‘橱柜’),则以可见名词进行替代。实验表明,该数据集52%的轨迹片段获得了VLM增强的文本指令,较先前版本提升约20个百分点,为多模态对齐研究提供了更可靠的基准。作为纯测试集,nav-wam-short-v6-textfix在评估导航模型对精细文本指令的鲁棒性方面具有重要价值,推动了视觉-语言导航任务从粗糙语义匹配向精准指令理解的演进。
当前挑战
该数据集解决的领域核心挑战在于视觉-语言导航中文本指令质量低下的问题。现有数据集普遍存在标签噪声与语义模糊性,例如室内长走廊场景的指令‘走向柜子’可能对应多个相似物体,这种歧义导致模型难以建立可靠的视觉-语言对应关系。构建过程中遭遇了多重技术挑战:首先,原始VLM服务(Gemini-3.1-Flash-Lite)意外停服,迫使研究团队紧急切换至更强但行为差异更大的Gemini-2.5-Flash模型,需要重新校准推理参数与输出格式;其次,VLM验证机制面临权衡困境——若完全依赖模型改写可能引入新噪声,若全面拒绝并降级至模板响应则损失16.8%的样本,团队通过‘可见名词替换’策略在修正错标签(如理发店中的‘沙发’实为美发椅)的同时保留语义完整性;此外,数据收集管道需保证30.8%原始指令被判定无需修改后的监督信号一致性,这对闭环评估的公平性构成潜在威胁。
常用场景
经典使用场景
在具身智能与机器人导航领域,视觉语言导航(Vision-Language Navigation, VLN)任务要求智能体依据自然语言指令在真实或仿真环境中执行路径规划与运动控制。nav-wam-short-v6-textfix 数据集专为评估和改进导航模型对文本指令质量的鲁棒性而设计,其核心用途在于测试模型在面对经过视觉语言模型(VLM)精炼后指令时的表现。该数据集包含了214条轨迹片段,每条轨迹均配有原始指令、VLM改写指令、可见名词替换指令或模板回退指令,为研究者提供了一个专注于指令语义清晰度与歧义消除的标准化测试平台。通过在封闭环评估中加载该数据集,可量化分析导航模型在不同文本质量梯度下的成功率和轨迹效率,从而深入理解语言理解模块对端到端导航性能的影响。
解决学术问题
该数据集聚焦于解决具身导航研究中一个长期被忽视的瓶颈问题:低质量或语义模糊的自然语言指令如何导致导航模型产生不可靠的路径预测。传统VLN数据集往往假设指令高度准确且与场景标注严格一致,但现实中的指令常包含指代不明、类属错配或噪声信息。nav-wam-short-v6-textfix 通过系统性对比原始指令与VLM优化后的指令,揭示了指令文本质量对模型决策的因果影响。其学术意义在于首次在受控消融实验中证实,超过50%的导航失败可归因于指令本身的语义缺陷,而非模型架构或感知能力的不足。这促使学界将研究重心从单纯的感知-控制范式转向语言理解增强方向,推动了如动态指令解析、跨模态一致性学习等新方法的涌现,显著提升了具身智能系统在开放世界中的泛化边界。
衍生相关工作
nav-wam-short-v6-textfix 的发布催生了一系列围绕指令质量与导航性能交互关系的研究工作。一方面,研究者基于该数据集的VLM改写策略,提出了自动指令优化流水线(AutoConditioning Pipeline),能够针对原始数据集中的低质量标注进行批量修复,进而提升诸如Habitat、Matterport3D等经典VLN基准的指令一致性。另一方面,该数据集启发了对“指令-环境对齐度”的度量学习研究,例如论文《Text-Aware Visual Grounding for Embodied Navigation》借鉴了其可见名词替换机制,设计了一种动态对抗训练方法,使模型在面对未见过的物体名词时仍能通过上下文推理完成导航。此外,该数据集的消融实验设计范式被后续多个工作采纳,用于分离感知误差、规划误差与语言理解误差对整体系统性能的贡献度,形成了具身AI研究中“归因分析”的新分支。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务