遇见数据集

PairedGTA

收藏
arXiv2026-05-31 更新2026-06-05 收录
数据链接:
官方服务:

资源简介:

PairedGTA是由圣安娜高级研究学院和比萨大学联合创建的一个用于自动驾驶视觉感知研究的合成数据集生成框架。该数据集基于GTA V游戏引擎构建,通过高保真渲染生成像素级对齐的驾驶场景图像,涵盖晴天、日落、夜间、雨天和雾天等多种光照与天气条件,每个场景在不同条件下保持完全一致的几何结构、相机姿态及动态物体身份与位置。数据集生成过程采用确定性程序化方法,首先采样虚拟世界中的位置并初始化场景,然后实例化车辆、行人等动态实体,最后在固定场景描述符下渲染不同光照条件的图像变体。该数据集专为受控的光度偏移分析而设计,旨在解决自动驾驶模型在恶劣环境下的鲁棒性评估问题,通过消除语义和几何因素的干扰,精确量化模型性能因光照变化而产生的退化。

PairedGTA is a synthetic dataset generation framework for autonomous driving visual perception research, jointly created by the Sant'Anna School of Advanced Studies and the University of Pisa. Built on the GTA V game engine, it generates pixel-aligned driving scene images via high-fidelity rendering, covering various lighting and weather conditions including clear sunny days, sunset, nighttime, rainy days and foggy days. For each scene, its geometric structure, camera pose, as well as the identities and positions of dynamic objects remain completely consistent across all different conditions. The dataset generation process adopts a deterministic procedural method: first, sample locations in the virtual world and initialize the scene; then instantiate dynamic entities such as vehicles and pedestrians; finally render image variants under different lighting conditions with a fixed scene descriptor. This dataset is specifically designed for controlled photometric shift analysis, aiming to address the robustness evaluation issue of autonomous driving models in harsh environments. By eliminating interference from semantic and geometric factors, it accurately quantifies the degradation of model performance caused by lighting changes.

创建时间:
2026-05-31
原始信息汇总

数据集概述

数据集名称:PairedGTA(基于 README 内容推断,地址为 https://github.com/Spearton/PairedGTA)

核心目标:评估语义分割模型在恶劣环境(如雨、雾、夜晚)下的鲁棒性,重点关注模型预测的一致性(Prediction Consistency),而非绝对精度。

关键特性

  • 成对图像评估:提供清晰场景与恶劣环境(如日间-雨天、日落-有雾)的成对图像,用于对比模型预测稳定性。
  • 像素级掩码一致性指标:通过计算干净和恶劣条件下像素预测一致的比例(Masked Pixel Agreement)来衡量鲁棒性。
  • 类别级保留分析:评估每个语义类别在环境变化下的预测保留率(Class Retention)。
  • 场景化评估:支持按特定环境切换(如 Day-Rain、Sunset-Foggy)进行细分评估。
  • 定性失败案例分析:支持可视化分析模型预测失败的典型情况。

数据集结构

预期数据集目录结构如下:

Dataset/ ├── Day/ ├── Sunset/ └── Night/

  • 各子目录下应包含成对的干净与恶劣条件图像(具体命名规则详见原始仓库说明)。
  • 无需真实标注(Ground Truth),评估完全基于模型预测的一致性。

评估指标

  • 掩码像素一致性Agreement = (1 / |A|) * Σ 1[p_clean == p_adv],其中 |A| 为掩码区域像素总数,p_clean 和 p_adv 分别为干净和恶劣条件下的预测类别。
  • 类别保留率Reference-based Retention_k,针对每个类别计算干净条件下预测正确的像素在恶劣条件下仍被预测为同一类的比例。

输出结果

运行基准测试后,将生成以下 CSV 文件:

  • results_pixel_agreement_per_image.csv(每张图像的像素一致性)
  • results_pixel_agreement_by_condition.csv(按条件汇总的像素一致性)
  • results_class_retention_by_condition.csv(按条件汇总的类别保留率)
  • framewise_target_class_counts.csv(帧级目标类别计数)
  • framewise_target_class_spearman.csv(帧级目标类别斯皮尔曼相关系数)

所有可视化结果以 PDF 格式 导出,存放于 out_cityscapes_final/plots/ranking_consistency_results/plots/ 目录下。

使用说明

  1. 安装环境:创建 Python 3.9 环境,安装依赖(torch, torchvision, transformers, huggingface_hub, matplotlib, pandas, tqdm, scipy, pyyaml)。
  2. 运行基准测试:依次执行以下 Jupyter Notebook:
    • notebooks/run_benchmarks_reference_metric.ipynb(运行主基准测试)
    • notebooks/plot_benchmarks_notebook.ipynb(生成结果图)
    • notebooks/extract_single_segmentation.ipynb(提取单帧分割)
    • notebooks/plot_mirror_ranking_from_csv.ipynb(生成镜像排名图)
  3. 模型配置:可通过修改 notebooks/benchmark_models.py 添加或移除参与评估的模型。

许可证

该数据集及代码基于 SantAnna 许可证发布(具体条款请参阅原始仓库中的 LICENSE 文件)。

搜集汇总
数据集介绍
PairedGTA 数据集图片
构建方式
PairedGTA数据集的构建依托于高保真游戏引擎GTA V,通过外部应用程序接口与引擎通信,实现场景的精确控制。构建过程分为三个阶段:首先,在虚拟世界的有效区域内采样位置并初始化自我车辆和相机位姿;其次,在该位置周围程序化地实例化动态对象(如车辆、行人等),并确保其位置不重叠,构建包含静态场景布局和动态对象配置的场景描述符;最后,针对每一种光照和天气条件组合,基于相同的场景描述符重新初始化并渲染图像,从而生成一组在几何、相机位姿和动态对象布局上完全对齐,仅光照和天气不同的图像对。所有变异图像在像素级别上保持对齐,确保了非光度因素完全固定。
特点
PairedGTA数据集的核心特点在于其实现了完美的像素级图像对齐,使得每次光度变化(如白天到夜晚、晴天到雨天)都能在完全相同的几何、相机视角和动态对象配置下独立评估。这种设计有效避免了真实世界中因场景结构、交通组成或相机位姿变化带来的混淆因素,使得模型性能的下降能够直接归因于光度变化本身。此外,该数据集覆盖了三种光照条件(白天、黄昏、夜晚)与三种天气状况(晴天、雨天、雾天)的全部组合,共计九种环境变体,为分析模型在不同环境下的鲁棒性提供了丰富的控制变量。
使用方法
PairedGTA数据集适用于自动驾驶场景中视觉感知模型的鲁棒性分析,特别是语义分割模型的光度偏移敏感性测试。研究者可将同一场景在不同光照和天气条件下的对齐图像输入已训练的模型,通过比较其输出预测的差异来评估模型对环境变化的鲁棒性。由于游戏引擎不直接提供像素级语义标签,论文推荐采用参考条件下高置信度的伪标签作为标准,通过对模型在干净参考图像与偏移条件下预测一致性的度量(如参考一致性得分)来量化性能退化。该方法无需依赖真实标签,适用于无监督的自洽性分析,并且能够揭示不同模型结构(如Transformer与卷积网络)在不同类别和条件下的特有鲁棒性表现。
背景与挑战
背景概述
在自动驾驶领域,视觉感知系统需在夜间、雨雾等恶劣环境下保持稳定性能。然而,现有真实世界数据集由于场景动态性,难以提供同一场景在不同光照与天气条件下的完美像素对齐图像。为此,Andrea Chianese、Giulio Rossolini等人于2024年依托意大利圣安娜高等研究学院与比萨大学,提出PairedGTA数据集——一种基于GTA V游戏引擎的生成框架。该框架通过软件接口实现场景几何、相机姿态及动态物体位置的严格可控,从而生成在光照与天气变化中完美对齐的图像对。PairedGTA的核心贡献在于为光照偏移分析提供了无混杂几何与语义变化的测试平台,推动了自动驾驶视觉模型鲁棒性的因果性研究,对领域内自监督分析与模型评估范式产生了重要影响。
当前挑战
PairedGTA所解决的领域问题在于:真实世界数据集(如ACDC)中,光照与天气变化常伴随场景几何、动态物体位置等不可控因素,导致模型性能下降的归因模糊。PairedGTA通过像素级对齐,将性能退化的根源精确归因于光度偏移,从而支持针对语义分割模型的细粒度自洽性分析。在构建过程中,主要挑战包括:1)通过GTA V底层API(如Script Hook V)实现场景参数的确定性控制,但需依赖第三方工具(DeepGTAV、VPilot),限制了调控精度;2)游戏引擎未直接提供语义标注,需依赖高置信度伪标签(如SegFormer-B5)进行参考一致性评估,可能引入模型偏好偏差;3)动态物体实例化需兼顾物理合理性(如避免重叠),同时维持场景多样性。上述挑战需通过启发式约束与手动验证来缓解。
常用场景
经典使用场景
在自动驾驶视觉感知领域,PairedGTA数据集最经典的使用场景是作为受控光度偏移分析的标准测试平台。通过基于GTA游戏引擎的高保真渲染管线,该数据集能够在保持场景几何结构、相机位姿及动态物体类别与位置完全一致的前提下,生成同一场景在不同光照(白天、黄昏、夜晚)和天气(晴朗、雨天、雾天)条件下的像素级对齐图像。这种完美配对特性为评估语义分割模型在光照或天气变化下的性能退化提供了理想的数据基础,使得研究人员能够将模型输出的差异直接归因于光度条件的变化,而非场景几何或语义内容的干扰。
解决学术问题
该数据集有效解决了现有真实数据集难以实现跨条件严格配对的关键学术问题。真实场景数据集如ACDC或Dark Zurich中,由于交通流、行人位置、相机视角等随时间变化,不同条件下的图像对往往存在几何与语义不一致,导致模型性能分析中光度变化与其他因素相互纠缠。PairedGTA通过生成完全像素对齐的反事实图像对,使得研究者能够独立量化光照衰减、雨雾遮挡等光度扰动对分割模型的影响,从而在自监督分析、模型鲁棒性评估等方向获得更纯净的对比基准,为理解模型在极端环境下的失效模式提供了前所未有的精细化视角。
衍生相关工作
PairedGTA的提出催生了一系列衍生工作,主要集中在三个方面:一是基于其完美配对特性,研究者开发了面向自监督域适应的对比学习方法,利用像素级对应性来训练光照不变的特征表示;二是催生了新型反事实鲁棒性评估协议,通过分析模型对固定场景下单一光度变量变化的响应,构建更细致的模型鲁棒性画像;三是启发了基于游戏引擎与生成式模型融合的合成数据生成框架,如将扩散模型嵌入渲染管线以模拟更丰富的环境退化模式,从而进一步扩展受控光度分析的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务