InstructScene
收藏资源简介:
InstructScene是由清华大学与GigaAI联合构建的大规模自动驾驶指令数据集,包含10万条标注自然语言指令与对应轨迹的场景数据,基于NAVSIM平台扩展生成。数据集通过视觉语言模型自动生成驾驶意图描述,并辅以规则化方法补充,形成图像-指令-动作三元组序列。其核心价值在于推动模仿驾驶向指令驾驶的范式转变,为个性化自动驾驶系统提供细粒度监督信号,支持视觉-语言-动作联合建模研究。
InstructScene is a large-scale autonomous driving instruction dataset jointly constructed by Tsinghua University and GigaAI. Expanded and generated based on the NAVSIM platform, it contains 100,000 pieces of scene data paired with annotated natural language instructions and their corresponding trajectories. The dataset automatically generates driving intention descriptions via vision-language models, supplemented by rule-based methods, to form image-instruction-action triplet sequences. Its core value lies in promoting the paradigm shift from imitation-based driving to instruction-driven driving, providing fine-grained supervisory signals for personalized autonomous driving systems, and supporting research on joint visual-language-action modeling.
Vega 数据集概述
数据集基本信息
- 数据集名称: Vega
- 核心功能: 一个视觉-语言-世界-动作模型,能够遵循自然语言指令生成多样化的驾驶动作和未来图像。
- 模型特点: 与传统仅能预测单一专家轨迹或遵循有限导航命令的驾驶模型不同,Vega 能够生成遵循多样化用户指令的多个规划轨迹和未来图像。
- 训练方法: 在训练阶段,利用世界建模来增强模型在复杂驾驶场景中的规划能力。
- 模型参数量: 14B
数据集构成与规模
- 训练集 (navtrain): 包含 85,109 个样本,提供基于规则的指令和视觉语言模型(VLM)生成的指令。
- 测试集 (navtest): 包含 12,146 个样本,提供基于规则的指令和视觉语言模型(VLM)生成的指令。
- 数据基础: 数据集基于 NAVSIM 构建。
性能表现
- NAVSIM v2 基准测试: 在不使用任何额外性能增强技术的情况下,获得 86.9 EPDMS 分数。采用最佳N策略后,达到顶级性能。
- NAVSIM v1 基准测试: 获得 87.9 PDMS 分数,与多模态 BEV 方法相当。采用最佳N策略后,提升至 89.8 PDMS。
数据与模型发布状态
- 预训练模型权重: 即将在 Hugging Face Hub 发布。
- 指令标注数据 (navtrain & navtest): 即将在 Hugging Face Hub 发布。
- 指令生成与数据处理脚本: 即将发布。
相关资源
- 论文地址: https://arxiv.org/abs/2603.25741
- 项目主页: https://zuosc19.github.io/Vega/
- 基础模型: 训练基于 ByteDance-Seed/BAGEL-7B-MoT (https://huggingface.co/ByteDance-Seed/BAGEL-7B-MoT)。
- 代码库: https://github.com/wzzheng/Vega.git
- 依赖数据集: NAVSIM (https://github.com/autonomousvision/navsim/blob/main/docs/install.md)

- 1Vega: Learning to Drive with Natural Language Instructions清华大学; GigaAI · 2026年



