遇见数据集

DaViNCi

收藏
arXiv2026-08-12 更新2026-08-14 收录
数据链接:
官方服务:

资源简介:

DaViNCi是由上海交通大学提出的首个户外动态视觉-语言导航数据集,旨在突破传统VLN数据集依赖离散固定拓扑图且缺乏动态元素的局限。该数据集基于CARLA模拟器构建,包含六个不同风格地图,共计6,933条高质量轨迹,路径长度约200至800米,指令词汇量达1.9k,并引入随机车辆与行人作为动态元素。数据通过追踪自动驾驶车辆生成连续路径,并利用视觉语言模型(VLM)结合人工微调生成与轨迹对齐的自然语言指令。该数据集主要用于推动户外VLN任务从离散静态环境向连续动态真实场景的迁移,为智能体在复杂交通环境中的导航研究提供更逼真的基准。

DaViNCi is the first outdoor dynamic vision-and-language navigation (VLN) dataset proposed by Shanghai Jiao Tong University, designed to overcome the limitations of traditional VLN datasets that rely on discrete fixed topological maps and lack dynamic elements. Constructed using the CARLA simulator, this dataset features six maps with distinct styles, totaling 6,933 high-quality trajectories. The path length ranges from 200 to 800 meters, the vocabulary size of the navigation instructions reaches 1.9k, and random vehicles and pedestrians are introduced as dynamic elements. During data collection, continuous paths are generated by tracking autonomous vehicles, and natural language instructions aligned with the trajectories are produced via vision-language models (VLMs) combined with manual fine-tuning. This dataset is primarily intended to facilitate the transition of outdoor VLN tasks from discrete static environments to continuous dynamic real-world scenarios, providing a more realistic benchmark for research on agent navigation in complex traffic environments.

提供机构:
上海交通大学
创建时间:
2026-08-12
原始信息汇总

DaViNCi 数据集详情总结

1 数据集概述

DaViNCi(Dynamic Vision-and-Language Navigation in Continuous Environment)是一个面向户外视觉-语言导航(VLN)任务的数据集,主要特点如下:

  • 范式转变:实现了从离散到连续、从静态到动态表示的户外车辆VLN数据集转变。
  • 测试基准:提供了离散环境和连续环境下的测试基准。
  • 实验验证:通过系列实验证明了数据集的有效性和挑战性,并提供了连续环境下的基线方法。

2 数据集构建方法

2.1 模拟器

数据集基于 CARLA 模拟器构建,该模拟器支持自主驾驶系统的开发、训练和验证,提供开放数字资产(城市布局、建筑、车辆)、传感器套件配置、环境条件控制、静态和动态参与者控制及地图生成等功能。

2.2 场景选择——地图

地图 环境描述
Town01 乡村环境,元素简单,包含低矮建筑、简单道路结构、溪流和桥梁等特征元素
Town02 乡村环境,道路结构比 Town01 更紧凑复杂,环境元素相对较多
Town03 包含道路高差的城镇环境,道路更宽、结构更复杂,含环岛、上下坡、隧道、五向交叉口等特殊元素
Town04 包含小镇区域的高速公路环境,含多车道行驶、进出口匝道、山地路段等高速元素
Town05 城市环境,包含高楼建筑、复杂道路结构及立交桥(涉及垂直坐标)
Town10 繁荣的城市环境,含博物馆、文化墙、大型购物中心、地铁站、公园等丰富元素,是数据集的主要采集地点

2.3 场景选择——交通场景

  • 交通与其他实体:智能体需遵守道路规则,与车辆、行人、骑行者等适当交互。
  • 交通交叉口:需综合处理交叉口道路结构中的各类信息。
  • 环岛:需综合处理环岛道路结构中的各类信息。
  • 变道:需在关键交叉口适时执行变道操作以合理导航指定路线。

2.4 路径生成

在排除所有额外动态交通参与者和移动障碍物的仿真环境中,随机生成的自动驾驶车辆执行自由导航任务。车辆行为决策和操作策略由自动驾驶控制程序实时自主确定。每1秒采样并记录一次自车位置坐标数据,按时间顺序连接拟合位置路径点,构建生成每次导航尝试对应的真实参考路径。轨迹数据存储在 JSON 文件中,包含每帧的道路信息和位置坐标信息。

2.5 指令生成

采用两阶段处理框架,并通过人工微调生成导航指令:

步骤1:基于轨迹数据的转向信息量化

  • 通过数学拟合和逻辑推理从轨迹 JSON 文件中提取精确的转向方向和时间间隔。
  • 轨迹被划分为水平/垂直直线行驶段,通过向量叉积计算识别左转/右转。
  • 结果记录在 result.txt 文件中,并生成带原始路径、拟合段和时间标注的可视化轨迹图。

步骤2:带校准转向事实的视频自然语言描述生成

  • 采用通义千问 Qwen 3-VL-Plus 多模态 API。
  • 严格遵循步骤1定义的转向方向,时间戳仅作内部参考且禁止出现在最终输出中。
  • 输出采用标准化导航指令格式(例如:直行 → 右转 → 沿左侧弯道行驶),不含时间信息。
  • 从视频帧中提取真实地标(例如:在红绿灯处右转、沿超市左侧弯道行驶)。
  • 明确区分交叉口转弯和道路弯道,以准确描述车辆操作的触发点。

3 实验

3.1 离散环境实验

离散化适配:Town01、Town02、Town10 采用 5m 细粒度,Town03 采用 12m 粗粒度。红色节点代表仅有一个出口的节点,黄色节点代表有多个出口的节点。

近期基线方法

  • VELMA:基于 LLM 的专用智能体,利用轨迹的语言表示和视觉环境观察作为上下文提示。
  • FLAME:三阶段自适应算法,包括单感知适应、多感知适应和端到端训练,最终形成多模态 LLM 智能体框架。
  • Mem4Nav:提出层次化空间认知长短期记忆系统,集成稀疏八叉树和语义拓扑图,通过可训练的 Transformer 嵌入存储于记忆令牌中。

结果:表格中报告了各模型在离散环境测试集上的性能表现。典型实例显示,长距离导航带来的记忆和对齐压力会在导航后期表现为错误。

3.2 连续环境实验

COVL-RL 方法:在每个时间步,模型接收文本导航指令、当前视觉观察和历史上下文来预测智能体的即时动作。采用的 PPO 优化目标包含:

  • Actor 损失:使用裁剪比率和优势函数优化策略。
  • Critic 损失:最小化 TD 误差。
  • 熵正则化:促进探索。

奖励函数设计

R = 5 + R_dist + R_dest

  • 距离奖励 R_dist:计算智能体与真实轨迹路径点的负最小欧氏距离,10米前瞻距离内识别真实路径点。
  • 终点奖励 R_dest:根据最终停止位置与目标终点的距离提供终端反馈,在范围内为 100 - distance,超出范围为 -100 - distance

早期终止策略:当智能体显著偏离真实轨迹(R < -10)时立即终止当前训练回合,避免错误探索浪费训练时间。

结果

  • 表格中比较了所提方法与随机方法在 DaViNCi 上的表现("-stop" 表示动作空间中无停止)。
  • 报告了不同粒度下的性能表现(粒度影响)。
  • 报告了不同动态元素数量下的性能表现(动态元素影响)。
搜集汇总
数据集介绍
DaViNCi 数据集图片
构建方式
DaViNCi数据集依托CARLA模拟器精心构建,选取六种风格迥异的户外地图(涵盖乡村、城镇、高速与复杂都市),通过自主车辆随机巡航记录轨迹,以一秒间隔采样生成地面真实路径。指令生成采用两阶段框架:先基于轨迹数据精确提取转向事件作为先验约束,再融合多模态视觉分析生成结构化导航指令,并辅以人工精细校准。视觉信息在导航过程中实时采集,摒弃了传统静态全景图,转而提供第一人称动态视角,同时引入随机车辆与行人作为动态元素,营造出充满变数的真实环境。
特点
DaViNCi作为首个融合连续动作与动态要素的户外VLN数据集,其核心特色在于突破图拓扑局限,允许智能体在开放地图上执行细腻的连续操控(如左转、变道),并需应对实时出现的行人与车辆,挑战视觉记忆与路径规划能力。路径长度涵盖200至800米,指令文本富含地标与方向词,长度超越Touchdown,提升了对齐难度。六幅地图各具特色,从简单乡村到复杂城市,含环岛、坡道等多样路况,总计6,933条轨迹,确保了数据集的广度与挑战性。
使用方法
该数据集支持离散与连续双模式评估。离散实验中,将连续轨迹按5米或12米粒度离散化,适配Touchdown格式,便于对比现有VLN模型;连续实验中,采用强化学习框架COVL-RL,智能体以第一视角RGB图像、文本指令及历史状态为输入,输出包含转向与停车的七种连续动作,并根据实时路况动态约束动作空间。数据划分上,离散模式按8:1:1随机分割,连续模式以town10为训练场景,其余五图作为未见场景,全面测试泛化能力。
背景与挑战
背景概述
视觉语言导航(VLN)作为多模态智能体研究的重要方向,近年来逐渐从室内场景拓展至室外环境。然而,现有户外VLN数据集,如Touchdown和Map2Seq,普遍依赖固定的离散拓扑图来约束智能体的行动空间,且环境中缺乏随时间演变的动态要素,难以真实反映复杂多变的实际驾驶场景,制约了智能体从仿真到现实世界的迁移能力。为突破这一瓶颈,上海交通大学的研究团队于2026年提出了DaViNCi数据集,旨在构建首个同时具备连续动作空间与动态环境要素的户外VLN数据集。该数据集基于CARLA模拟器,覆盖六个各具特色的城镇地图,共包含6,933条高质量轨迹,通过创新性的数据采集与指令生成流程,实现了文本指令与视觉信息的高度对齐。DaViNCi的推出不仅丰富了户外VLN的研究资源,更为智能体在真实交通环境中的部署提供了关键评测基准。
当前挑战
DaViNCi数据集的研发直面多重挑战。首先,在领域问题层面,现有VLN数据集多采用离散拓扑结构进行导航,忽略车辆运动的连续性与复杂的交通规则,而真实室外环境要求智能体能够理解连续动作空间,并在动态障碍物(如行人、车辆)干扰下做出实时决策,这远超传统离散静态环境的难度,导致在DaViNCi上现有方法的成功率显著下降逾10%。其次,在数据构建层面,如何在模拟器中生成覆盖多样化场景且轨迹自然合理的路径,以及如何利用视觉语言模型从第一视角车辆视频中生成精确遵循转向指令与地标描述的导航文本,均为技术难题。此外,需确保动态元素的引入不影响指令与视觉得一致性,同时兼顾指令长度与词频分布的有效性,最终通过严格的质量控制,剔除碰撞或违规轨迹,保障数据集的可靠性与实用性。这些挑战共同构成了DaViNCi推动户外VLN迈向真实应用的重要价值。
常用场景
经典使用场景
DaViNCi数据集作为首个融合连续动作与动态元素的户外视觉-语言导航基准,其经典使用场景聚焦于推动VLN任务从离散静态环境向连续动态现实场景的范式迁移。研究者可依托该数据集,在CARLA模拟器构建的六个多样化城镇地图中,让智能体遵循自然语言指令,通过连续动作空间(如转向、变道、停止)实时感知动态交通参与者(车辆与行人),从而检验并提升智能体在接近真实户外条件下的路径规划、视觉-语言对齐及动态避障能力。
解决学术问题
该数据集精准回应了现有户外VLN研究的两大局限:一是依赖固定离散拓扑图,无法映射真实车辆连续运动特性;二是环境完全静态,缺乏随时间变化的动态交互要素。DaViNCi通过引入连续轨迹与实时动态元素,弥合了室内外VLN在连续环境研究上的鸿沟,为评估智能体在动态交通场景下的语义理解、空间推理和自适应决策提供了标准化测试平台,显著推动了VLN从模拟到真实部署的学术探索进程。
衍生相关工作
DaViNCi的提出催生了若干引领性后续研究。一方面,研究者基于其离散化版本改进现有VLN模型(如VELMA、FLAME),引入记忆增强或多模态大语言模型以应对更长指令与复杂地标对齐的挑战;另一方面,为适应其连续动态场景,学界发展了融合强化学习与在线视觉语言理解的COVL-RL框架,以及针对动态元素干扰的鲁棒感知策略。此外,该数据集还激发了关于动作粒度对导航性能影响的系统性探讨,为构建更通用的户外VLN评估体系奠定了新基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务