遇见数据集

FlameVQA

收藏
arXiv2026-06-25 更新2026-06-29 收录
官方服务:

资源简介:

FlameVQA是由克莱姆森大学研究团队构建的专用于野火监测的视觉问答基准数据集,基于FLAME 3公开数据集中的同步航空RGB与辐射热成像图像对开发。该数据集包含约6,100个多模态样本,每个样本配备34个精心设计的多项选择题,涵盖存在检测、分类、分布估计、空间定位、跨模态推理和飞行规划六大能力维度,问题总数达20余万条。数据创建过程采用混合标注策略,结合多模态大语言模型生成初始答案,通过确定性热力学规则进行物理验证,并实施跨问题一致性检查与人工审核确保标签可靠性。该数据集主要应用于无人机野火监测领域,旨在评估和提升多模态模型在安全关键场景下的感知与推理能力,解决现有遥感VQA基准在灾害特定领域模态信号利用不足的问题。

FlameVQA is a visual question answering (VQA) benchmark dataset dedicated to wildfire monitoring, developed by a research team at Clemson University. It is constructed using paired synchronous aerial RGB and radiometric thermal imagery from the public FLAME 3 dataset. The dataset contains approximately 6,100 multimodal samples, each paired with 34 well-designed multiple-choice questions covering six capability dimensions: existence detection, classification, distribution estimation, spatial localization, cross-modal reasoning, and flight planning, with a total of over 200,000 questions. The data creation process adopts a hybrid annotation strategy, which combines initial answer generation via multimodal Large Language Models (LLMs), conducts physical validation using deterministic thermodynamic rules, and implements cross-question consistency checks and manual reviews to ensure label reliability. Primarily applied in the field of unmanned aerial vehicle (UAV)-based wildfire monitoring, this dataset aims to evaluate and enhance the perception and reasoning capabilities of multimodal models in safety-critical scenarios, addressing the issue of insufficient utilization of modal signals in disaster-specific domains by existing remote sensing VQA benchmarks.

提供机构:
克莱姆森大学
创建时间:
2026-06-25
原始信息汇总

数据集概述

WildFire VQA 是一个大规模、多模态的视觉问答(VQA)基准数据集,专门用于航空野火监测场景。该数据集结合了辐射热成像与可见光图像,旨在评估大型视觉语言模型(VLM)在多模态野火监测任务上的表现。


数据集发布平台

同时,项目还关联了FLAME系列公开数据集:


数据格式

评估器接受两种JSON格式:

  • Checkpoint风格: {"type":"checkpoint","items":...}
  • 列表风格: [{...}, {...}]

每条数据(每行)包含以下必要字段:

  • question_id: 问题唯一标识符
  • question: 问题内容
  • options: 选项列表(非空)
  • gt_answeranswer: 标准答案
  • rgb_path: RGB图像路径(用于rgbrgb_thermal模式)
  • thermal_path: 热成像图像路径(用于thermalrgb_thermal模式)

可选字段:

  • temp_summary: 温度摘要(包含min, max, mean, top3_mean

支持的任务与模式

评估管道支持多种输入模态,可用于模型消融实验:

  • rgb: 仅使用可见光图像
  • thermal: 仅使用热成像图像
  • rgb_thermal: 同时使用可见光与热成像图像

支持的可选消融设置:

  • Prompt重复: --repeat-prompt
  • 温度摘要: --no-temp-summary(关闭温度摘要)

支持的模型

模型名称 对应Hugging Face标识
llava llava-hf/llava-v1.6-mistral-7b-hf
qwen Qwen/Qwen3-VL-8B-Instruct
llama3.2 meta-llama/Llama-3.2-11B-Vision-Instruct
internvl2 OpenGVLab/InternVL2-8B
minicpm openbmb/MiniCPM-V-2_6
pixtral mistralai/Pixtral-12B-2409

评估输出

每次运行生成的输出文件包括:

  • *_preds.jsonl: 每个问题的预测结果
  • *_metrics.json: 聚合指标及运行元数据
  • *_dryrun.json: 干运行验证报告(若启用--dry-run

metrics.json中包含:

  • overall: 总体准确率
  • by_category: 按类别准确率
  • run_config: 运行配置
  • more_info: 队列、跳过、异常等信息

引用方式

bibtex @misc{habibpour2026wildfirevqalargescaleradiometricthermal, title={WildFireVQA: A Large-Scale Radiometric Thermal VQA Benchmark for Aerial Wildfire Monitoring}, author={Mobin Habibpour and Niloufar Alipour Talemi and John Spodnik and Camren J. Khoury and Fatemeh Afghah}, year={2026}, eprint={2604.20190}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2604.20190}, }

搜集汇总
数据集介绍
FlameVQA 数据集图片
构建方式
FlameVQA是基于FLAME 3数据集构建的火焰视觉问答基准,其核心创新在于利用无人机采集的配准RGB影像与辐射热TIFF数据。对于每个场景,数据集提供对齐的RGB图像、彩色映射的热红外可视化图像以及存储逐像素温度值的辐射热TIFF文件,为温度驱动的推理任务提供物理基础。数据来源于三次受控燃烧试验,包括Sycan Marsh、Willamette和Shoetank,总计约6100对RGB-热红外样本。每张图像配备34个精心设计的多选题,涵盖火灾检测、分类、分布估计、空间定位、跨模态推理和无人机飞行规划六大能力维度,形成系统化的森林火情智能评估框架。
特点
FlameVQA的显著特点在于其物理锚定的标注机制与多模态协同设计。数据集采用混合标注策略,结合大语言模型自动生成初步答案,并通过确定性热红外规则进行验证,例如根据辐射TIFF中像素级温度阈值判定热点存在区域、通过EXIF元数据计算无人机飞行高度类别。同时,引入跨问题一致性检查,对语义关联的问答对(如无火情则热点相关答案必须为无)进行逻辑约束,有效降低标签噪声。此外,数据集特别关注浓烟遮挡、尺度变化等挑战性场景,通过热红外数据可发现RGB图像中不可见的隐蔽热点,为安全关键推理提供独特评价维度。
使用方法
FlameVQA以标准多选题形式提供评测接口,每条样本包含RGB图像、热红外可视化图和辐射热TIFF文件。用户可将三模态数据输入多模态大语言模型,要求模型从4个候选项中选择正确答案。数据集附带开源评测代码,支持批量推理与精度统计。研究者可复现论文中的基线评估流程,也可针对特定能力组(如跨模态推理或火点定位)进行分项测试。建议在推理时随机排列选项顺序以消除语言模型位置偏差,对于温度阈值相关问题可直接从TIFF中提取精确像素值进行硬性验证,从而严格评估模型在火灾监测场景中的视觉语言推理能力。
背景与挑战
背景概述
在无人机遥感与灾害监测领域,视觉问答(VQA)技术为自然语言驱动的空中影像语义查询提供了灵活途径,然而现有遥感VQA基准多聚焦于RGB光学影像与通用语义问题,缺乏针对野火场景中多模态推理与温度关键任务的系统性评估。在此背景下,Clemson大学的研究团队于2026年提出FlameVQA基准,该工作由Mobin Habibpour等学者主导,依托FLAME 3数据集,首创性地融合了无人机采集的RGB图像与辐射热TIFF数据,旨在推动野火监测中基于物理温度的安全关键推理。FlameVQA的诞生填补了野火领域多模态VQA基准的空白,通过覆盖检测、定位、分布估计、跨模态推理及飞行规划等六类操作能力,为评估多模态大语言模型在灾害响应中的真实表现提供了标准化平台,对促进鲁棒且领域适配的智能监测系统发展具有里程碑意义。
当前挑战
FlameVQA所应对的核心领域挑战在于野火场景中单一RGB视觉信号的局限性——浓烟、尺度变化和遮挡常导致火焰与热点的误判或漏判,亟需辐射热红外信号的物理温度支撑以实现可靠空间推理。在构建过程中,研究者面临多重技术困境:首先,标注可靠性难以保障,故采用多模态大语言模型(MLLM)辅助标注与确定性热规则结合的策略,并通过跨问题一致性检查与人工审核来降噪;其次,温度临界问题的精确标注需直接解析单波段热TIFF中的像素级温度值,而非依赖调色板可视化,这要求算法能处理辐射测量数据并进行阈值化热点提取;此外,数据集涵盖多燃烧场地的约6100帧样本,需保证各类问题(如覆盖估计、空间定位)在高度变化场景下的物理一致性,同时应对浓烟遮挡下主观测度差异带来的标注歧义,这构成了该基准构建中最为棘手的挑战。
常用场景
经典使用场景
FlameVQA作为首个面向无人机野火监测的视觉问答基准,其经典使用场景在于评估多模态大语言模型在复杂野外火灾场景中的联合推理能力。该数据集利用FLAME 3中配准的可见光RGB图像与辐射热红外TIFF数据,为每帧图像设计了34道涵盖六大操作能力组的多项选择题,包括火情检测、烟雾定位、覆盖范围估算、跨模态推理及飞行规划等任务。通过温度物理锚定的答案标注框架,研究者可系统性地检验模型在烟雾遮挡、尺度变化及热信号混淆等挑战性条件下的视觉—语言理解水平,从而推动野火智能监测技术的发展。
实际应用
在实际应急救援场景中,FlameVQA直接支撑无人机自主巡检系统的智能决策能力评估。消防指挥中心可利用该基准筛选出能准确回答‘当前火势活跃度’‘最近水源方位’‘飞行区域烟雾可见度’等操作级问题的视觉问答模型,提升火场态势感知效率。该数据集的温度物理验证机制还可用于开发热红外与RGB图像融合的预警模块,在浓烟遮蔽时依然能够通过热异常检测定位潜在复燃点。此外,其飞行规划类问题有助于优化无人机自主避障与航线重规划算法,减少火灾响应中的人力依赖与决策延迟。
衍生相关工作
FlameVQA的发布催生了一系列衍生研究,首当其冲的是基于其物理校验机制的标注质量评估框架,研究者借鉴其MLLM辅助标注与确定性热规则结合的混合标注策略,构建了通用灾害场景下的低成本高质量数据集生成管线。其次,该基准暴露的覆盖估算与烟尘检测瓶颈,推动了面向野火场景的域自适应多模态模型设计,例如通过辐射热红外温度场指导可见光特征重构的对比学习架构,以及融合温度物理先验的遮挡感知视觉定位网络。此外,其六类能力组的划分范式被后续工作扩展至洪水、地震等其它灾害域,形成了多灾害VQA基准评估体系的基础蓝图。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务