遇见数据集

TartanAdversity

收藏
Hugging Face2026-07-22 更新2026-07-23 收录
官方服务:

资源简介:

TartanAdversity是一个合成的、经过增强的自动驾驶目标检测数据集。该数据集以BDD100K数据集的清晰天气街景为基础,通过两种不同的增强流程(生成式的Gemini Flash 2.0图像到图像重渲染和程序化的Automold道路增强库)重新渲染为三种恶劣天气条件(雾天、雨天、雪天),并完整保留了原始的目标边界框标注。数据集的核心研究目的是探索合成训练数据的“可学习性”,即评估使用此类合成天气数据训练的检测器模型在真实世界恶劣天气图像(如DAWN、ACDC、Foggy Zurich数据集)上的泛化与迁移能力。数据集包含一个训练集,共36,000张图像。数据在两种增强来源(`gemini` 和 `automold`)和三种天气条件(`foggy`、`rainy`、`snowy`)之间均匀平衡,形成6个分组,每组包含6,000张图像。每张图像都附带其来源、天气条件、原始文件名,并提供了YOLO和COCO两种格式的目标检测标注,方便直接接入不同的训练流程。标注遵循BDD100K的10类目标分类体系,包括自行车、巴士、汽车、摩托车、行人、骑行者、交通灯、交通标志、火车和卡车。YOLO标注使用归一化的边界框中心坐标和宽高,而COCO标注使用绝对像素坐标的边界框并包含面积和拥挤标志字段。该数据集主要作为合成训练材料,用于与真实数据混合训练目标检测模型,并在真实的恶劣天气验证集上进行评估。需要注意的是,图像是合成的近似,并非真实的恶劣天气捕获,并继承了BDD100K的地理、相机、类别平衡等偏差。数据集发布在CC-BY-4.0许可下,使用时需引用本数据集及原始的BDD100K数据集。

创建时间:
2026-07-14
原始信息汇总

数据集概述:TartanAdversity

TartanAdversity 是一个通过合成数据增强的自动驾驶目标检测数据集。它选取 BDD100K 中的晴朗天气街景,使用两种不同的增强管线在恶劣天气(雾、雨、雪)下重新渲染,并保留原始目标标注。该数据集旨在研究合成训练数据的可学习性:即检测器在合成天气数据上训练后,对真实恶劣天气图像的泛化能力。

数据集规模与结构

  • 总样本数:36,000 张图像,全部位于训练集(train)。
  • 存储格式:HuggingFace datasets Parquet 分片,地址为 data/
  • 图像尺寸:约 1024 像素宽(例如 1024×573,从 BDD100K 原生 1280×720 按比例缩小)。
  • 每个样本包含的字段
字段 类型 描述
image image 增强后的 RGB 场景图像(JPEG 格式)。
source string 产生该图像的增强管线:gemini(生成式)或 automold(程序化)。
file_name string 该场景在 BDD100K 中的原文件名。
weather string 应用的合成天气条件:foggy(雾)、rainy(雨)或 snowy(雪)。
yolo_annotations struct YOLO 格式的边界框标注(归一化坐标)。
coco_annotations struct COCO 格式的边界框标注(绝对像素坐标)。

标注格式详解

两种标注结构描述的是同一批目标,仅在索引和框编码上不同:

  • yolo_annotations:平行列表
    • class_id (int64):0 索引类别,范围为 0…9。
    • class_name (string):可读类别名称。
    • bbox (float32[4]):归一化[x_center, y_center, width, height],取值在 [0, 1]
  • coco_annotations:平行列表
    • category_id (int64):1 索引类别,范围为 1…10。
    • category_name (string):可读类别名称。
    • bbox (float32[4]):绝对像素 [x, y, width, height](左上角为原点)。
    • area (float32):框的面积(像素²)。
    • iscrowd (int64):COCO 的 crowd 标记(标准框均为 0)。

数据来源与分组

数据集根据增强管线天气条件两个维度进行平衡划分,形成 2 × 3 = 6 个分组,每组恰好 6,000 张图像:

  • 增强管线(source
    • gemini:基于 Gemini Flash 2.0 的生成式图像到图像重渲染(学习型、逼真的天气合成)。
    • automold:基于 Automold 库的程序化计算机视觉增强(经典天气效果)。
  • 天气条件(weatherfoggy(雾)、rainy(雨)、snowy(雪)。

目标类别(BDD100K 10类检测分类法)

YOLO class_id(0索引) COCO category_id(1索引) 类别名称
0 1 bike
1 2 bus
2 3 car
3 4 motor
4 5 person
5 6 rider
6 7 traffic light
7 8 traffic sign
8 9 train
9 10 truck

使用场景与注意事项

  • 设计目的:该数据集旨在回答:“如果你用生成式或程序化方法将晴朗驾驶场景转化为恶劣天气,这些合成数据的可学习性和可迁移性有多强?” 在配套基准测试中,模型(带有 ResNet/ConvNeXt 骨干的 Faster R-CNN 和 YOLO)在真实 BDD100K 图像与 TartanAdversity 图像的混合数据上训练,然后在真实恶劣天气数据集(DAWN、ACDC、Foggy Zurich)上评估。
  • 限制
    • 图像是恶劣天气的合成近似,逼真度因方法而异(生成式 vs 程序化)。
    • 继承自 BDD100K 的地理、相机、类别平衡和时段分布偏差。
    • 仅提供单一训练集,无原生验证/测试集;评估需使用真实恶劣天气数据集。
    • 标注反映原始清晰场景的标签;严重的天气效果可能会遮挡部分被标注的目标。
  • 加载提示:如果 load_dataset 卡住,建议设置环境变量 HF_HUB_DISABLE_XET=1 以强制使用普通 HTTPS 下载。

许可与引用

  • 许可协议CC-BY-4.0。数据集衍生自 BDD100K,用户需同时遵守 BDD100K 的原始使用条款并引用。使用时需注明 TartanAdversity(卡内基梅隆大学)和 BDD100K。
  • 引用:使用本数据集时,建议引用 TartanAdversity、BDD100K、Gemini Flash 2.0 以及 Automold 库。
搜集汇总
数据集介绍
TartanAdversity 数据集图片
构建方式
TartanAdversity数据集是基于BDD100K晴朗天气街景图像,通过两种不同的图像增强管线合成恶劣天气(雾、雨、雪)构建而成。其一为生成式方法,借助Gemini Flash 2.0模型执行图像到图像的重新渲染,以生成逼真的天气效果;其二为程序化方法,采用Automold路况增强库中的经典计算机视觉操作模拟天气变化。所有图像的原始物体标注信息均得以完整保留,仅对场景外观进行变换,最终形成包含36,000张图像的训练集,每种天气条件与增强管线的组合均均衡分布,各含6,000张图像。
特点
该数据集的核心特点在于同时提供生成式与程序化两种合成天气增强方式,构建了2×3的天气与来源交叉矩阵,支持对比研究不同合成策略的效果差异。所有图像均附带COCO与YOLO两种标注格式,且标注信息直接继承自BDD100K,确保与主流目标检测框架无缝兼容。每个样本均记录其原始来源、天气类别及文件名,便于精细筛选与分析。作为完全合成的数据集,它专为评估合成训练数据在实际恶劣天气场景下的泛化能力而设计。
使用方法
用户可通过HuggingFace datasets库直接加载该数据集,执行`load_dataset("JohnYanxinLiu/TartanAdversity", split="train")`即可获取训练样本。每个样本以字典形式存储,包含PIL图像对象、来源与天气标签,以及YOLO与COCO两种格式的边界框标注。用户可依据`source`与`weather`字段进行过滤,例如筛选出特定增强管线与天气条件的子集。标注信息可直接输入YOLO或Faster R-CNN等检测框架进行训练,无需额外格式转换。
背景与挑战
背景概述
TartanAdversity是由卡内基梅隆大学John Yanxin Liu团队于2026年创建的一个合成增强自动驾驶目标检测数据集。该数据集以BDD100K晴朗天气街景为基底,通过生成式与程序化两种管道重新渲染出雾、雨、雪等恶劣天气场景,旨在探究合成训练数据的可学习性与可迁移性。作为一项基准研究的核心组成部分,它系统性地评估了基于合成恶劣天气数据训练的检测模型在真实恶劣天气数据集(如DAWN、ACDC)上的泛化能力。该数据集包含36,000张图像,每张图像同时提供YOLO与COCO格式的标注,为自动驾驶感知领域中的域适应与数据增强研究提供了关键实验平台。
当前挑战
该数据集主要应对两大挑战。其一,领域问题层面,真实恶劣天气下的自动驾驶目标检测性能严重受限,主要源于真实恶劣天气数据稀缺、标注成本高昂且场景多样性不足。其二,构建过程层面,合成数据与真实数据之间的域差异构成核心难点——生成式管道(Gemini Flash 2.0)虽能产生更逼真的视觉效果,但可能引入伪影;程序化管道(Automold)则难以模拟复杂的光学物理效应。此外,继承自BDD100K的地理、光照与类别分布偏差,以及恶劣天气下部分目标被遮挡后仍保留原始标注所引入的标签噪声,均对模型训练与评估构成挑战。
常用场景
经典使用场景
TartanAdversity数据集的核心应用场景在于为自动驾驶目标检测模型提供在恶劣天气条件下的合成训练数据。该数据集基于BDD100K中的晴好天气街景,通过生成式(Gemini Flash 2.0)与程序化(Automold)两种增强管线,系统性地将场景重新渲染为雾、雨、雪三种天气状态,并完整保留原始标注信息。研究者可直接依循YOLO或COCO标注格式加载图像,通过筛选特定天气类别或增强来源,构建多样化的训练素材,从而评估模型在真实恶劣天气数据(如DAWN、ACDC)上的泛化表现。
衍生相关工作
围绕TartanAdversity已衍生出若干重要的后续研究工作。首先,该数据集催生了对合成数据来源可控性评估的相关工作,例如对比生成式模型(如扩散模型)与传统图像处理库在视觉保真度与标注一致性上的差异。其次,基于其源场景与增强参数的显式记录,研究者得以开展细粒度的领域自适应研究,量化不同天气模式对检测性能的独立影响。最后,该数据集还推动了跨数据集迁移学习基准的建立,促成了如基于多源合成数据训练、统一恶劣天气检测框架等前沿方法的探索,拓宽了合成数据在自动驾驶感知领域的理论实践边界。
数据集最近研究
最新研究方向
TartanAdversity数据集聚焦于自动驾驶领域中对恶劣天气条件下目标检测鲁棒性的前沿探索。通过将BDD100K晴朗场景经生成式(Gemini Flash 2.0)与程序化(Automold)两条管道重渲染为雾、雨、雪等逆境图像,该研究系统揭示了合成训练数据在真实恶劣天气场景中的可学习性与迁移能力。结合DAWN、ACDC等实测基准,TartanAdversity不仅量化了生成式增广与经典视觉库在域适应上的性能鸿沟,更推动了自动驾驶感知系统在复杂气象条件下的实用化评估,其双标注格式也为YOLO与Faster R-CNN等主流检测架构的无缝集成提供了便利。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务