DaViNCi
收藏资源简介:
DaViNCi是由上海交通大学提出的首个户外动态视觉-语言导航数据集,旨在突破传统VLN数据集依赖离散固定拓扑图且缺乏动态元素的局限。该数据集基于CARLA模拟器构建,包含六个不同风格地图,共计6,933条高质量轨迹,路径长度约200至800米,指令词汇量达1.9k,并引入随机车辆与行人作为动态元素。数据通过追踪自动驾驶车辆生成连续路径,并利用视觉语言模型(VLM)结合人工微调生成与轨迹对齐的自然语言指令。该数据集主要用于推动户外VLN任务从离散静态环境向连续动态真实场景的迁移,为智能体在复杂交通环境中的导航研究提供更逼真的基准。
DaViNCi is the first outdoor dynamic vision-and-language navigation (VLN) dataset proposed by Shanghai Jiao Tong University, designed to overcome the limitations of traditional VLN datasets that rely on discrete fixed topological maps and lack dynamic elements. Constructed using the CARLA simulator, this dataset features six maps with distinct styles, totaling 6,933 high-quality trajectories. The path length ranges from 200 to 800 meters, the vocabulary size of the navigation instructions reaches 1.9k, and random vehicles and pedestrians are introduced as dynamic elements. During data collection, continuous paths are generated by tracking autonomous vehicles, and natural language instructions aligned with the trajectories are produced via vision-language models (VLMs) combined with manual fine-tuning. This dataset is primarily intended to facilitate the transition of outdoor VLN tasks from discrete static environments to continuous dynamic real-world scenarios, providing a more realistic benchmark for research on agent navigation in complex traffic environments.
DaViNCi 数据集详情总结
1 数据集概述
DaViNCi(Dynamic Vision-and-Language Navigation in Continuous Environment)是一个面向户外视觉-语言导航(VLN)任务的数据集,主要特点如下:
- 范式转变:实现了从离散到连续、从静态到动态表示的户外车辆VLN数据集转变。
- 测试基准:提供了离散环境和连续环境下的测试基准。
- 实验验证:通过系列实验证明了数据集的有效性和挑战性,并提供了连续环境下的基线方法。
2 数据集构建方法
2.1 模拟器
数据集基于 CARLA 模拟器构建,该模拟器支持自主驾驶系统的开发、训练和验证,提供开放数字资产(城市布局、建筑、车辆)、传感器套件配置、环境条件控制、静态和动态参与者控制及地图生成等功能。
2.2 场景选择——地图
| 地图 | 环境描述 |
|---|---|
| Town01 | 乡村环境,元素简单,包含低矮建筑、简单道路结构、溪流和桥梁等特征元素 |
| Town02 | 乡村环境,道路结构比 Town01 更紧凑复杂,环境元素相对较多 |
| Town03 | 包含道路高差的城镇环境,道路更宽、结构更复杂,含环岛、上下坡、隧道、五向交叉口等特殊元素 |
| Town04 | 包含小镇区域的高速公路环境,含多车道行驶、进出口匝道、山地路段等高速元素 |
| Town05 | 城市环境,包含高楼建筑、复杂道路结构及立交桥(涉及垂直坐标) |
| Town10 | 繁荣的城市环境,含博物馆、文化墙、大型购物中心、地铁站、公园等丰富元素,是数据集的主要采集地点 |
2.3 场景选择——交通场景
- 交通与其他实体:智能体需遵守道路规则,与车辆、行人、骑行者等适当交互。
- 交通交叉口:需综合处理交叉口道路结构中的各类信息。
- 环岛:需综合处理环岛道路结构中的各类信息。
- 变道:需在关键交叉口适时执行变道操作以合理导航指定路线。
2.4 路径生成
在排除所有额外动态交通参与者和移动障碍物的仿真环境中,随机生成的自动驾驶车辆执行自由导航任务。车辆行为决策和操作策略由自动驾驶控制程序实时自主确定。每1秒采样并记录一次自车位置坐标数据,按时间顺序连接拟合位置路径点,构建生成每次导航尝试对应的真实参考路径。轨迹数据存储在 JSON 文件中,包含每帧的道路信息和位置坐标信息。
2.5 指令生成
采用两阶段处理框架,并通过人工微调生成导航指令:
步骤1:基于轨迹数据的转向信息量化
- 通过数学拟合和逻辑推理从轨迹 JSON 文件中提取精确的转向方向和时间间隔。
- 轨迹被划分为水平/垂直直线行驶段,通过向量叉积计算识别左转/右转。
- 结果记录在 result.txt 文件中,并生成带原始路径、拟合段和时间标注的可视化轨迹图。
步骤2:带校准转向事实的视频自然语言描述生成
- 采用通义千问 Qwen 3-VL-Plus 多模态 API。
- 严格遵循步骤1定义的转向方向,时间戳仅作内部参考且禁止出现在最终输出中。
- 输出采用标准化导航指令格式(例如:直行 → 右转 → 沿左侧弯道行驶),不含时间信息。
- 从视频帧中提取真实地标(例如:在红绿灯处右转、沿超市左侧弯道行驶)。
- 明确区分交叉口转弯和道路弯道,以准确描述车辆操作的触发点。
3 实验
3.1 离散环境实验
离散化适配:Town01、Town02、Town10 采用 5m 细粒度,Town03 采用 12m 粗粒度。红色节点代表仅有一个出口的节点,黄色节点代表有多个出口的节点。
近期基线方法:
- VELMA:基于 LLM 的专用智能体,利用轨迹的语言表示和视觉环境观察作为上下文提示。
- FLAME:三阶段自适应算法,包括单感知适应、多感知适应和端到端训练,最终形成多模态 LLM 智能体框架。
- Mem4Nav:提出层次化空间认知长短期记忆系统,集成稀疏八叉树和语义拓扑图,通过可训练的 Transformer 嵌入存储于记忆令牌中。
结果:表格中报告了各模型在离散环境测试集上的性能表现。典型实例显示,长距离导航带来的记忆和对齐压力会在导航后期表现为错误。
3.2 连续环境实验
COVL-RL 方法:在每个时间步,模型接收文本导航指令、当前视觉观察和历史上下文来预测智能体的即时动作。采用的 PPO 优化目标包含:
- Actor 损失:使用裁剪比率和优势函数优化策略。
- Critic 损失:最小化 TD 误差。
- 熵正则化:促进探索。
奖励函数设计:
R = 5 + R_dist + R_dest
- 距离奖励 R_dist:计算智能体与真实轨迹路径点的负最小欧氏距离,10米前瞻距离内识别真实路径点。
- 终点奖励 R_dest:根据最终停止位置与目标终点的距离提供终端反馈,在范围内为
100 - distance,超出范围为-100 - distance。
早期终止策略:当智能体显著偏离真实轨迹(R < -10)时立即终止当前训练回合,避免错误探索浪费训练时间。
结果:
- 表格中比较了所提方法与随机方法在 DaViNCi 上的表现("-stop" 表示动作空间中无停止)。
- 报告了不同粒度下的性能表现(粒度影响)。
- 报告了不同动态元素数量下的性能表现(动态元素影响)。




