遇见数据集

DisasterBench

收藏
arXiv2026-06-04 更新2026-06-08 收录
官方服务:

资源简介:

DisasterBench是一个面向复杂环境下无人机灾害响应的多阶段多模态推理基准数据集,由电子科技大学等机构联合创建,旨在评估灾害应急响应中的高级推理能力。该数据集包含5,330张真实低空无人机图像,构建了29,300个推理导向的样本,覆盖火灾、滑坡、洪水等14种灾害场景以及灾前、灾中、灾后阶段的9项关键任务。数据通过从无人机来源收集图像并经过人工清理与专家标注,采用结构化提示生成多项选择题-答案对,并经过跨模型验证与专家审核以确保质量。该数据集主要应用于多模态大语言模型的灾害推理能力评估,旨在解决实际应急响应中所需的因果归因、灾害传播预测、损失评估及面向决策的推理等核心挑战。

DisasterBench is a multi-stage, multi-modal reasoning benchmark dataset tailored for UAV-based disaster response in complex environments, co-developed by institutions including the University of Electronic Science and Technology of China. Its core objective is to evaluate advanced reasoning capabilities in disaster emergency response. This dataset contains 5,330 real low-altitude UAV images and 29,300 reasoning-oriented samples, covering 14 disaster scenarios such as fire, landslide and flood, as well as nine key tasks across pre-disaster, during-disaster and post-disaster stages. The dataset is constructed by collecting images from UAV sources, followed by manual cleaning and expert annotation, generating multiple-choice question-answer pairs via structured prompts, and validated through cross-model verification and expert review to ensure data quality. It is primarily applied to assess the disaster reasoning capabilities of multi-modal large language models, aiming to address core challenges in practical emergency response, including causal attribution, disaster propagation prediction, loss assessment and decision-oriented reasoning.

创建时间:
2026-06-04
原始信息汇总

数据集概述

DisasterBench 是一个专为基于无人机的灾害响应场景设计的多模态基准数据集,旨在评估和推动复杂环境下的灾害推理能力。该数据集与论文《DisasterBench: A Multimodal Benchmark for UAV-Based Disaster Response in Complex Environments》相关联。

核心特点

  • 多模态基准:专注于无人机在灾害响应中的多模态推理任务。
  • 复杂任务分类体系:覆盖灾前、灾中、灾后三个阶段的任务分类。
  • 轻量级视觉语言模型:配套提出 DisasterVL 模型,专用于灾害推理。
  • 课程引导训练:采用课程式训练策略,实现高效的令牌级灾害推理。

数据集结构

数据集以 data/ 目录组织,目前仅公开了 测试集,训练集和验证集尚未发布。

目录 状态 说明
data/test/ ✅ 已公开 用于评估的测试集
data/train ❌ 未公开 训练集目录,当前为空
data/val ❌ 未公开 验证集目录,当前为空

获取方式

数据集与代码的官方仓库地址为:https://github.com/TanmouTT/DisasterBench

搜集汇总
数据集介绍
DisasterBench 数据集图片
构建方式
灾害响应任务对多阶段因果推理与实时边缘计算能力提出了严苛要求,然而现有基准多聚焦于感知层面,难以覆盖灾前、灾中、灾后全链条的推理需求。为此,DisasterBench应运而生,其构建遵循一套严谨的四阶段流水线:首先,从公开灾害报告、新闻媒体及视频平台收集5,330张真实低空无人机影像,并经过人工清洗与类别标注;其次,针对每张影像,依据其灾害类型与所处阶段,设计结构化的灾害-任务配对,并借助精心编排的提示词生成条件化的多项选择问题;随后,引入跨模型验证环节,由多个强视觉语言模型独立作答,仅保留答案一致的样本,以消除标注噪声;最后,经由两名具备灾害响应背景的标注专家历时约三个月进行AI辅助质量审查与人工校验,对约17%的生成项进行修订或剔除,最终构建出包含29,300个高质量推理样本的可靠基准。
特点
DisasterBench的核心特色在于其对多阶段、多类型灾害推理能力的系统性评估,突破了传统基准局限于单一阶段或简单感知任务的藩篱。该基准涵盖了14种灾害相关场景类型,包括滑坡、洪水、火山碎屑流等,并额外纳入正常场景以评估模型的预判鲁棒性。在任务维度上,它定义了9项贯穿灾前风险评估、灾中情景理解与因果推理、灾后损失评估与资源调配的全流程关键任务,并设置了一项全局性的灾害链总结任务,要求模型整合观测信息形成具有显式因果关系的结构叙事。更重要的是,所有任务均以统一的多项选择视觉问答格式呈现,并通过精细的灾害-任务映射确保对因果归因、演变预测、损伤分析与决策导向推理的定向测试,从而为评估模型在复杂环境下的结构化、多步骤推理能力提供了真实且具有挑战性的测试平台。
使用方法
DisasterBench为评估与推动轻量化多模态灾害推理模型的发展提供了统一且可复现的实验协议。所有样本遵循多项选择视觉问答格式,模型需针对给定无人机影像与问题,从选项中选出正确答案,性能以最终答案的精确匹配准确率衡量。数据集已划分为24,357个训练样本、1,943个验证样本和3,000个测试样本,确保评估的公平性与可复现性。研究者在进行模型评估时,应严格遵循统一的题设格式与结构化输出要求,确保推理过程的可追溯性。为进一步验证模型在边缘设备上的实用性,该基准配套提出了DisasterVL模型,其采用三阶段渐进式训练框架,即领域知识注入、链式思维引导的多模态对齐与基于强化学习的策略优化,在2B参数量级下即实现了与GPT-4o可比的推理准确率与更高的推理效率,为在计算资源受限的无人机平台上部署高效灾害推理系统提供了有价值的参考范式。
背景与挑战
背景概述
DisasterBench由电子科技大学、大连理工大学、兰开斯特大学及海南大学的研究团队于2026年联合构建,聚焦于复杂环境下基于无人机的多阶段多模态灾害推理。该基准的核心研究问题在于,实践中的应急响应不仅需要感知灾害的表象,更要求对因果归因、灾变传播、损失评估及决策导向推理进行深层理解。不同于以往的单一灾种或单阶段数据集,DisasterBench涵盖了14种灾害场景与9项关键任务,贯穿灾前、灾中、灾后全生命周期,由此推动了灾害智能领域从感知层向认知层的范式跃迁。其发布不仅为多模态大语言模型的灾情推理能力提供了严谨的评估平台,也为低空无人机在边缘设备上的实时推理奠定了实验基础。
当前挑战
DisasterBench所解决的领域挑战在于,真实应急响应需在噪声大、视野受限的低空无人机视角下,完成多阶段因果推理,而非简单的视觉分类或描述。现有基准多忽视灾种与任务之间的耦合关系,无法支持救灾中‘发生了什么、为何发生、将怎样发展、该如何应对’的逻辑链条。在构建过程中,研究团队面临了数据获取和标注的双重难题:低空无人机影像来源多样、质量参差,需经多轮清洗与人工审核;同时,为了确保推理任务的现实性与一致性,团队设计了一套包含跨模型一致性验证和领域专家复审的四阶段管线,最终对约17%的生成样本进行了修正或剔除,才得以构建出高保真、强鲁棒的多元推理基准。
常用场景
经典使用场景
DisasterBench作为一个专为无人机视角下复杂环境灾害响应设计的跨阶段多模态推理基准,其最经典的使用场景在于系统性地评估和提升大语言模型在灾前风险评估、灾中态势理解与级联风险推理、以及灾后损失评估与资源调度等全生命周期任务上的推理能力。研究者通常利用该基准中的14类灾害场景与9项响应关键任务,对模型进行涵盖因果归因、演进预测及决策导向的多步推理测试,以全面衡量其在真实应急领域的认知水平。
解决学术问题
该数据集有效解决了当前灾害相关多模态基准过于聚焦感知层面(如识别与描述)、缺乏对灾害阶段间动态推理耦合建模的学术困境。DisasterBench通过精细的灾种-任务映射结构,明确要求模型在低空无人机观测的噪声与局部遮挡条件下进行因果推理、传播路径推断与级联效应分析,从而推动了从单一感知评估向多阶段结构化推理的范式转变,为灾害智能响应研究提供了可复现的严格评测平台。
衍生相关工作
DisasterBench的发布催生了一系列富有影响力的下游研究工作。受其多阶段推理框架启发,学术界涌现出多项针对灾害链条摘要生成、因果关系可视化以及跨灾种泛化能力增强的模型优化方案。此外,该基准所提出的三级渐进式训练策略——领域知识注入、结构化思维链对齐与强化学习策略优化——已成为轻量级灾害推理模型的标准构建范式,推动了诸如Qwen2.5-VL、InternVL等主流开源模型在应急推理任务上的专项改进与效率提升。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务