遇见数据集

DisasterChain

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

DisasterChain是一个高质量、多模态的数据集,旨在推动因果推理、环境监测和灾害影响评估研究。该数据集基于EM-DAT数据库,提供了自2014年以来全球1,400多个极端环境事件的全面重建。与传统仅提供静态元数据的灾害目录不同,DisasterChain引入了“基于真实事件的因果影响链”(Grounded Causal Impact Chains),使用先进的大语言模型(Qwen 2.5 72B和Llama 3 70B)逐步提取物理和社会经济影响的因果序列(例如:极端降水→河流泛滥→洪水→基础设施损坏→人口流离失所)。关键的是,因果链中的每一步都通过已核实的新闻引用严格锚定于真实世界报道,保证了零幻觉率。此外,每个事件都附有多模态数据,包括21天的天气时间序列(来自Open-Meteo API)和多光谱卫星图像可用性(Sentinel-1/2/3),使其成为连接自然语言处理(NLP)与地球观测(EO)的独特资源。数据集支持因果推理与事件提取、多模态灾害评估(结合卫星图像、气象数据和文本来预测物理损坏或人员伤亡)、以及气候影响分析等任务。数据以JSON格式提供,每个事件包含根元数据(标准标识符、地理坐标、日期、人口影响指标)、weather_data(事件前后统计摘要及21天逐日时间序列)、satellite_data(受影响区域的边界框及传感器可用性数组)、news_data(信息来源及相关性得分)、summary(由Llama 3生成的简洁事实叙述)和causal_chain(由Qwen 2.5生成的规范化因果步骤,包含事件类型、描述和支持性引文)。数据集的构建遵循严格的多阶段管道,包括事件锚定、多模态检索、文本上下文收集、因果提取(使用模糊匹配算法验证引文)、以及语义规范化(将500+原始事件类型归一化为约390个标准化类别)。需要注意的偏差包括:因果链的丰富程度偏向于获得国际或英语媒体广泛报道的事件,卫星光学图像在恶劣天气下受云层影响(提供Sentinel-1 SAR作为补充)。

DisasterChain is a high-quality, multimodal dataset designed to advance research in causal reasoning, environmental monitoring, and disaster impact assessment. Based on the EM-DAT database, it provides a comprehensive reconstruction of over 1,400 extreme environmental events worldwide since 2014. Unlike traditional disaster catalogs offering only static metadata, DisasterChain introduces Grounded Causal Impact Chains extracted step by step using advanced large language models (Qwen 2.5 72B and Llama 3 70B) to capture causal sequences of physical and socioeconomic impacts (e.g., extreme precipitation → river overflow → flood → infrastructure damage → population displacement). Critically, each step in the causal chain is strictly grounded in verified news citations, ensuring zero hallucination. Additionally, each event is accompanied by multimodal data, including 21-day weather time series (from Open-Meteo API) and multispectral satellite imagery availability (Sentinel-1/2/3), making it a unique resource bridging Natural Language Processing (NLP) and Earth Observation (EO). The dataset supports tasks such as causal reasoning and event extraction, multimodal disaster assessment (combining satellite imagery, meteorological data, and text to predict physical damage or casualties), and climate impact analysis. Data is provided in JSON format, with each event containing root metadata (standard identifiers, geographic coordinates, dates, population impact indicators), weather_data (pre- and post-event statistics summaries and 21-day daily time series), satellite_data (bounding boxes and sensor availability arrays for affected areas), news_data (sources and relevance scores), summary (concise factual narratives generated by Llama 3), and causal_chain (normalized causal steps generated by Qwen 2.5, including event types, descriptions, and supporting citations). The dataset construction follows a rigorous multi-stage pipeline including event anchoring, multimodal retrieval, text context collection, causal extraction (with fuzzy matching algorithms to verify citations), and semantic normalization (normalizing 500+ original event types to approximately 390 standardized categories). Notable biases include richer causal chains for events with broad international or English media coverage, and satellite optical imagery affected by cloud cover in adverse weather (with Sentinel-1 SAR provided as a supplement).

创建时间:
2026-09-22
原始信息汇总

DisasterChain 数据集概述

基本信息

  • 数据集地址:https://huggingface.co/datasets/Franco7Scala/DisasterChain
  • 主页:http://disasterchain.icar.cnr.it
  • 仓库:https://github.com/Franco7Scala/DisasterChain
  • 联系点:Francesco Scala(francesco.scala@icar.cnr.it)
  • 许可证:Apache-2.0
  • 语言:英语(en)
  • 数据规模:1K 至 10K
  • 任务类别:文本生成、视觉问答、时间序列预测、文本分类
  • 标签:气候变化、自然灾害、因果推理、多模态、地球观测、Sentinel、Open-Meteo、EM-DAT

数据集摘要

DisasterChain 是一个高保真、多模态数据集,旨在推进因果推理、环境监测和灾害影响评估领域的研究。该数据集基于 EM-DAT 数据库构建,全面重建了 2014 年以来超过 1,400 起全球极端环境事件。

与仅提供静态元数据的传统灾害目录不同,该数据集引入了 Grounded Causal Impact Chains(有据可依的因果影响链)。利用先进的大型语言模型(Qwen 2.5 72B 和 Llama 3 70B),提取物理和社会经济影响的逐步因果序列(例如:极端降水 -> 河流泛滥 -> 洪水 -> 基础设施损毁 -> 人口流离失所)。因果链中的每一步都通过经过验证的支持性引文严格锚定到真实世界新闻报道。

每个事件还通过多模态数据得到丰富,包括 21 天天气时间序列和多光谱卫星影像可用性,使其成为连接自然语言处理(NLP)与地球观测(EO)的独特资源。

支持的任务与应用

  • 因果推理与事件抽取:训练模型识别非结构化文本中的级联效应;
  • 多模态灾害评估:结合卫星影像(Sentinel-1、Sentinel-2)、天气数据和文本,预测物理损害或人员伤亡;
  • 气候影响分析:分析特定天气触发因素在不同全球区域的 socio-economic 下游影响。

数据集结构

数据集以 JSON 格式提供。核心 JSON 结构为每个灾害事件包含以下嵌套对象:

1. 根元数据与影响数据

标准化标识符、地理坐标、日期以及来自 EM-DAT 的定量人类影响指标(死亡人数、受影响人口、经济损失)。

2. weather_data

通过 Open-Meteo API 获取,包含:

  • 事件前后统计摘要(平均降雨量、降雪量、最低/最高气温);
  • 捕捉事件前、中、后气象演变的 21 天每日时间序列。

3. satellite_data

通过 Copernicus Data Space Ecosystem(CDSE)/ Sentinel Hub 获取:

  • 受影响区域的精确边界框(bbox);
  • Sentinel-1(SAR)、Sentinel-2(光学/假彩色)和 Sentinel-3(热红外)的时间可用性数组;
  • 与 ESA WorldCover 土地利用数据的集成。

4. news_data

关于信息检索过程的元数据:

  • 查询来源(Google News、ReliefWeb、IFRC、Wikipedia);
  • 相关性分数和过滤惩罚项,确保仅保留高质量、事件特定的新闻文本。

5. summary 与 causal_chain(LLM 推理层)

  • Summary:由 Llama 3 70B 生成的事件简明、事实性叙述。
  • Causal Chain:由 Qwen 2.5 72B-Instruct 生成。一个规范化的 JSON 数组,包含灾害的时间顺序步骤。每一步包括:
    • type_event:语义规范化类别(例如:洪水、伤亡、基础设施损毁);
    • description:影响的具体表现;
    • supporting_quote:来自检索新闻上下文的精确或模糊匹配引文,确保因果抽取的 零幻觉率;
    • token_usage:计算足迹追踪。

方法论与数据流水线

该数据集的构建遵循严格的多阶段流水线,旨在消除 LLM 幻觉并确保物理一致性:

  1. 事件锚定:从 EM-DAT(2014 年后)获取基础事件,并通过 Nominatim 对位置进行地理编码;
  2. 多模态检索:自动获取历史天气数据和卫星影像足迹;
  3. 文本上下文收集:抓取、解析并算法化评分新闻文章的相关性;
  4. 因果抽取:使用 Qwen-72B 抽取因果图。应用严格的基于 Python 的模糊匹配算法(阈值 ≥ 0.80),将每个 LLM 生成的引文与原始新闻文本进行交叉引用。任何未经验证的因果步骤都会被系统性剔除;
  5. 语义规范化:将 500 多个原始事件类型算法化规范化为约 390 个标准化类别的清晰分类体系。

偏差、风险与局限

  • 媒体报道偏差:因果链的丰富程度和新闻数据的可用性天然偏向于获得大量国际或英语媒体报道的事件。偏远地区的事件可能因果链较短。
  • 卫星数据可用性:云层覆盖严重影响恶劣天气事件(如飓风)期间 Sentinel-2 光学影像的可用性。提供 Sentinel-1 SAR 以缓解此问题。

引用

如果使用该数据集,请引用论文:

bibtex Coming soon...

搜集汇总
数据集介绍
DisasterChain 数据集图片
构建方式
该数据集以EM-DAT灾害数据库为基底,筛选2014年以来全球逾1400起极端环境事件,通过Nominatim完成地理编码,继而调用Open-Meteo接口获取事件前后各21天气象时序,借助哥白尼数据空间生态系统的Sentinel系列影像提取灾区边界框与时间可用性数组,并利用Google News、ReliefWeb等渠道爬取并评分新闻语料。在此基础上,采用Qwen 2.5 72B与Llama 3 70B进行因果链抽取与摘要生成,所有因果步骤均经阈值不低于0.80的模糊匹配算法回溯至原始新闻引文,未通过验证的步骤被系统性剔除,最终经语义归一化将500余种原始事件类型压缩为约390个标准类别。
使用方法
研究者可依据JSON格式的嵌套结构,按根元数据、气象数据、卫星数据、新闻数据、摘要与因果链等层级解析事件记录。在因果推理任务中,可利用因果链字段训练模型识别级联效应,并通过支持引文验证抽取结果的可靠性;在多模态灾害评估中,可将Sentinel影像边界框与气象时序作为输入特征,结合文本摘要预测物理损毁或人员伤亡;在气候影响分析中,可跨区域聚合标准化事件类型与灾损指标,剖析特定气象触发因子的下游社会经济后果。使用者需留意媒体报道偏差与云层对光学影像可用性的制约。
背景与挑战
背景概述
极端气候事件频发背景下,灾害影响的链式传导机制成为环境科学与灾害研究的核心议题。DisasterChain数据集由意大利国家研究委员会ICAR研究所的Francesco Scala等人于2024年构建,依托EM-DAT数据库,系统重建了2014年以来全球逾1400起极端环境事件。该数据集首创“有据可依的因果影响链”范式,利用大语言模型抽取物理与社会经济影响的逐步因果序列,并将每一步严格锚定于真实新闻报道,实现了零幻觉率的因果抽取。其融合气象时序、卫星影像与结构化叙事,架起了自然语言处理与地球观测之间的桥梁,为气候影响分析与多模态灾害评估提供了关键基础设施。
当前挑战
灾害因果推理领域长期面临事件级联效应难以量化、多源异构数据难以对齐的困境,传统灾害目录仅提供静态元数据,无法刻画从气象触发到社会经济后果的完整传导路径。DisasterChain的构建亦遭遇多重挑战:媒体覆盖偏差导致偏远地区事件的因果链条显著偏短,英语报道的丰富度直接制约数据完整性;云层遮挡严重影响Sentinel-2光学影像在飓风等恶劣天气下的可用性;从非结构化新闻中抽取因果步骤时,大语言模型易产生幻觉,需以模糊匹配算法逐条核验引用,任何未经验证的因果步骤均被系统性剔除;逾500种原始事件类型需归一化为约390个标准类别,语义对齐难度显著。
常用场景
经典使用场景
在灾害链推理与多模态事件理解领域,DisasterChain数据集最经典的使用场景在于训练与评估模型对级联灾害效应的因果抽取能力。研究者依托其细粒度因果链标注与新闻引证,构建端到端的因果推理模型,用以识别从极端降水、河流溢流到基础设施损毁、人口流离等逐级传导的灾害演变路径。同时,该数据集将卫星影像、气象时序与结构化叙事融为一体,催生了跨模态灾害评估这一典型任务,即联合Sentinel-1/2观测、21天气象序列与文本叙事,对灾害物理损伤与人员伤亡进行综合预测。
解决学术问题
该数据集有力回应了灾害研究中长期存在的因果链条难以量化、跨模态数据割裂等核心难题。传统灾害目录多局限于静态元数据,缺乏对致灾因子至社会经济影响的逐步追溯机制,而DisasterChain通过严格的引文比对与语义归一化,提供了可验证的因果影响链,显著降低了因果抽取中的幻觉风险。其多源异构数据集成方式,为气候影响分析、灾害脆弱性评估及跨区域对比研究提供了标准化基准,推动了地球观测与自然语言处理交叉领域的可复现研究。
实际应用
在防灾减灾与应急管理实践中,DisasterChain为灾害影响快速评估与预警系统提供了关键数据支撑。基于其因果链与多模态特征,业务部门可构建灾情自动研判模型,在灾害发生后迅速推断潜在级联风险,如由洪水引发的交通中断与人员安置需求。气象与卫星数据融合能力,亦有助于提升对云遮挡条件下灾区的持续监测水平,为国际救援组织与政策制定者提供更为精准的态势感知与资源调度依据。
数据集最近研究
最新研究方向
在气候变化与极端灾害频发的背景下,DisasterChain数据集正推动因果推理与环境监测的深度融合。基于EM-DAT数据库,该数据集构建了2014年以来1400余起极端事件的多模态因果影响链,涵盖气象时间序列、Sentinel卫星影像及新闻文本,并借助大语言模型实现零幻觉的因果步骤提取。当前研究前沿聚焦于利用该数据集训练模型识别灾害 cascading effects,结合多源遥感与文本信息进行灾害影响评估与气候下游效应分析。其创新之处在于将NLP与地球观测紧密桥接,为因果推理、事件抽取及多模态灾害预测提供了高保真基准,对提升全球灾害响应与气候适应能力具有重要科学与现实意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务