MVVLP
收藏资源简介:
多视角视觉与语言停车数据集,包含实际停车场的多视角图像、大型语言模型生成的停车指令、自动泊车算法评价平台以及强化学习方法的实现。
The Multi-view Vision-and-Language Parking Dataset contains multi-view images captured from real-world parking lots, parking instructions generated by large language models, an automatic parking algorithm evaluation platform, and implementations of reinforcement learning methods.
MVVLP: Multi-View Vision-and-Language Parking Dataset
数据集概述
- 名称: Multi-View Vision-and-Language Parking Dataset (MVVLP)
- 任务类别: 图像到文本 (image-to-text)
- 论文: MVVLP: A Multi-View Benchmark Dataset for Vision-and-Language Navigation in Real-World Parking Scenarios
- 会议: NeurIPS 2025 (submitted)
- 作者: Pengyu Fu*, Jincheng Hu*, Jihao Li*, Ming Liu, Jingjing Jiang, Yuanjian Zhang
- 代码库: https://github.com/ilm75862/MVVLP
数据集内容
核心组件
-
多视角图像数据集:
- 4个停车场结构
- 144个拍摄点
- 4种不同视角
- 17个采集时间点
- 2492张经过隐私处理的图像
-
标注数据:
- 144个停车位
- 2736个停车位固有属性
- 1178个停车状态
-
自然语言指令数据集:
- 5种指令风格
- 150组语义表示
- 750条需求驱动的指令
- 250条随机指令
数据特征
- Instruction: 字符串类型
- ScnceID: 整型
- DATE: 字符串类型
- Cam0-Cam3: 图像类型
- prefect action: 整型
- ParkingID: 整型
- PathID: 整型
- LocID: 整型
- Column-Wall-Fire-Bump-Charging-Disabled-Temp-Lift-Stair-Corner-Mirror-Minisight-Sunlight-camera-Limit-Exit: 整型(0/1)
- Occupied-Around: 浮点型
数据组织
目录结构
MVVLP/ ├── data/ │ ├── Command/ │ │ ├── raw_command.json │ │ ├── long_command.json │ │ ├── test_command.json │ │ ├── short_command.json │ │ ├── synonyms_command.json │ │ ├── abstract_command.json │ │ └── random_command.json │ └── Vision/ │ ├── Park_1/ │ │ ├── 20250416/ │ │ │ ├── parking_slots.json │ │ │ ├── cam0/ │ │ │ │ ├── 000000.jpg │ │ │ │ ├── 000001.jpg │ │ │ │ └── ... │ │ │ ├── cam1/ │ │ │ │ ├── 000000.jpg │ │ │ │ ├── 000001.jpg │ │ │ │ └── ... │ │ │ └── ... │ │ ├── 20250422/ │ │ └── ... │ ├── Park_2/ │ └── ... ├── trajectory/ │ ├── part_0.parquet │ ├── part_1.parquet │ ├── part_2.parquet │ └── ... └── ...
数据分割
- Trajectory_part1 到 Trajectory_part18
- 对应数据文件: trajectory/part_0.parquet 到 trajectory/part_18.parquet
应用场景
- 多视角感知
- 自然语言指令理解
- 自动代客泊车(AVP)算法评估
- 强化学习框架基准测试
- 真实场景数据集集成




