遇见数据集

A_oveview_of_awesome_causality_dataset

收藏
github2025-12-08 更新2026-06-04 收录
官方服务:

资源简介:

该合集概述了因果关系数据集,广泛用于因果关系相关任务(如SemEval挑战),涵盖SemEval系列中的多个数据集(如SemEval-2010 Task 8、SemEval-2012 Task 7、SemEval-2020 Task 5)以及Causal-TimeBank等,提供数据集的描述、样本数量、示例和预处理信息,主题领域包括语义关系分类、因果推理和反事实检测。

This collection provides an overview of causal relation datasets, which are widely used in causal-related tasks such as the SemEval Challenge. It covers multiple datasets from the SemEval series, including SemEval-2010 Task 8, SemEval-2012 Task 7, SemEval-2020 Task 5, and Causal-TimeBank, among others. The collection offers dataset descriptions, sample counts, examples, and preprocessing information, with its thematic domains encompassing semantic relation classification, causal reasoning, and counterfactual detection.

创建时间:
2020-11-19
原始信息汇总

因果数据集概览

该页面汇总了多个广泛应用于因果关系任务的数据集,涵盖SemEval系列及其他公开基准数据集。

SemEval系列数据集

Dataset-1: SemEval-2010 Task 8

  • 任务: 语义关系的多分类(名词对之间的10种关系)
  • 关系类别: Cause-effect, Component-whole, Entity-destination, Entity-origin, Product-producer, Member-collection, Message-topic, Content-container, Instrument-agency, Other
  • 样本总量: 10,674条
  • 因果关系样本: 1,325条
  • 示例: 句子中标注的cause-effect关系对可用于直接提取
  • 资源链接: GitHub | 论文
  • 备注: 仅筛选cause-effect关系即可直接使用因果对

Dataset-2: SemEval-2012 Task #7 (COPA)

  • 任务: 开放域常识因果推理(关于日常事件的因果推理)
  • 示例: 给定前提"男人摔断了脚趾",从两个候选中选择原因
  • 预处理示例: 将前提和候选项转化为事件三元组(如 <man, broke, toe>)
  • 资源链接: 官网 | 论文

Dataset-3: SemEval-2020 Task 5

  • 任务: 反事实检测(因果推理中的反事实建模)
  • 示例: 句子包含假设前提和结果,标注了前提和结果的起止位置
  • 预处理: 提取条件/假设原因事件和效果事件
  • 资源链接: 竞赛页面

其他因果数据集

Dataset-4: Causal-TimeBank (CausalTB)

  • 来源: TimeBank语料库中的TempEval-3数据,额外标注了因果信息
  • 样本总量: 2,470条句子
  • 因果关系样本: 244条
  • 数据格式: XML格式标注事件和时序关系(如AFTER)
  • 资源链接: 官网 | 论文

Dataset-5: Event StoryLine (EventSL)

  • 样本总量: 4,107条句子
  • 因果关系样本: 77条
  • 资源链接: 论文

Dataset-6: BioCausal

  • BioCausal-Large: 13,342条来自PUBMED的句子,其中7,562条为因果关系
  • BioCausal-Small: 2,000条句子,其中1,113条为因果关系
  • 资源链接: 官网 | 论文

Dataset-7: CauseEffectPairs benchmark

  • 任务: 区分因果对中的原因和效果
  • 数据特点: 每个样本包含两个变量x和y及真实因果方向
  • 示例: 斯特林发动机的逆速度与温度数据,真实因果关系为x ← y
  • 资源链接: 官网 | 论文

Dataset-8: Infant Health and Development Program (IHDP)

Dataset-9: Twins

  • 数据规模: 11,984对双胞胎数据
  • 资源链接: GitHub | 论文

Dataset-10: ACIC Benchmark

  • 任务: 基于2016年大西洋因果推断竞赛的数据和模拟
  • 资源链接: GitHub

其他辅助数据集

事件表示与因果提取方法

事件表示

事件E定义为动词和名词的集合(E = {Wi | Wi ∈ Verbs ∪ Nouns}),例如句子"Williams retired because of overuse, agent says."中事件表示为(Williams, retired)。

因果对提取方法

  1. 模式(因果线索)提取: 基于因果提示词的模式匹配
  2. TimeML改进提取: 基于TimeML标注框架的因果提取方法
搜集汇总
数据集介绍
A_oveview_of_awesome_causality_dataset 数据集图片
构建方式
该数据集概览系统整合了因果推断领域内广泛应用的公开数据集,其构建基于对SemEval系列评测任务、Causal-TimeBank、Event StoryLine、BioCausal、CauseEffectPairs、IHDP、Twins及ACIC Benchmark等多个来源的梳理与归纳。每个数据集均源自权威学术会议或竞赛,如SemEval-2010 Task 8通过多分类标注了10种语义关系,其中因果对可直接筛选使用;SemEval-2020 Task5则聚焦反事实推理,提供前提与后果的精确位置标注。此外,Causal-TimeBank在TempEval-3语料基础上新增因果注释,而BioCausal从PubMed文献中提取了大规模生物医学因果句对。这些数据集通过事件抽取、模式匹配或人工标注等方式构建,形成了涵盖通用领域与专业场景的因果语料库。
使用方法
使用该数据集概览时,研究者可根据具体任务需求直接选取相应子集。对于因果关系分类任务,可优先采用SemEval-2010 Task 8中标注的Cause-Effect类别样本;进行因果推理评估时,COPA数据集提供了结构化的前提与备选原因/结果对。在预处理层面,部分数据集如Causal-TimeBank以XML格式存储事件与关系,需通过解析标记提取因果链接;而BioCausal则已提供可直接加载的句子级标注。对于因果效应估计,IHDP与Twins数据集常结合CEVAE等模型进行反事实预测。此外,所有数据集均附有原始论文与下载链接,便于复现实验与对比基线结果。
背景与挑战
背景概述
因果推理作为人工智能领域的核心议题,其研究进展高度依赖于高质量标注数据集的构建。该数据集汇总了自SemEval-2007系列评测以来涌现的多个经典因果语料库,涵盖SemEval-2010任务8中的名词对语义关系分类、SemEval-2012任务7中的常识因果推理(COPA)、以及SemEval-2020任务5中的反事实推理等前沿方向。由米兰大学、卡内基梅隆大学等机构的研究人员主导,这些数据集聚焦于从自然语言文本中自动识别因果事件对、区分原因与结果、以及建模条件性因果关系等核心科学问题。作为因果自然语言处理领域的基准资源,它们推动了基于模式匹配、时间关系推理和深度学习的因果抽取方法的发展,对知识图谱构建、事件预测和可解释人工智能产生了深远影响。
当前挑战
该领域面临的首要挑战在于因果关系的隐晦性与多样性:自然语言中的因果表达常依赖语境线索(如时序标记、语义角色),而非显性因果词,导致模式匹配方法召回率低下。其次,现有数据集规模有限且领域分布不均——如Causal-TimeBank仅含244个因果句,而BioCausal虽大但局限于生物医学领域,难以支撑跨域泛化模型训练。在构建层面,人工标注因果关系的成本极高且主观性强,不同标注者对隐含因果关系的判断存在歧义,例如COPA任务中常识推理的边界界定困难。此外,反事实推理数据(如SemEval-2020任务5)的稀缺性制约了模型对假设性因果链的建模能力,而事件抽取中细粒度因果角色(如工具、结果)的标准化标注仍是未解难题。
常用场景
经典使用场景
该数据集集合了多个因果推理领域的经典基准,广泛应用于因果关系的识别与分类任务。其中SemEval-2010 Task 8数据集聚焦于名词对之间的语义关系分类,涵盖因果、整体-部分等10类关系,常用于训练和评估因果句检测模型。COPA数据集则面向开放域常识推理,要求模型从两个备选事件中选出合理的因果前提或结果,成为检验常识因果推理能力的标杆。Causal-TimeBank和Event StoryLine数据集为时序因果标注提供了丰富资源,常用于事件因果链的抽取与时间关系分析。BioCausal数据集专注于生物医学领域,为因果句检测提供了大规模标注语料。CauseEffectPairs基准则通过成对变量数据,支持因果方向推断方法的评测。这些数据集共同构成了因果推理研究的核心测试床。
解决学术问题
该数据集集合系统地解决了因果推理领域多个关键学术问题。在因果关系识别方面,SemEval-2010 Task 8数据集提供了多类语义关系标注,使研究者能够从文本中自动区分因果与其他语义关系,推动了因果关系抽取技术的发展。COPA数据集解决了开放域常识因果推理的难题,为评估模型对日常事件因果逻辑的理解能力提供了标准化测试。Causal-TimeBank和Event StoryLine填补了时序因果标注的空白,支持事件间因果与时序关系的联合建模,促进了事件因果链的自动构建。IHDP、Twins和ACIC Benchmark等数据集聚焦于因果效应估计,为处理混淆偏差、选择偏差等统计因果推断问题提供了真实和模拟数据,推动了潜在结果框架下的因果推断方法研究。
实际应用
在实际应用中,这些数据集支撑了多个领域的因果分析系统开发。在智能问答与对话系统中,基于COPA和SemEval数据集的因果推理模型可帮助系统理解用户问题的因果逻辑,生成更合理的回答。在生物医学领域,BioCausal数据集训练的因果句检测模型被用于从海量文献中自动提取疾病-症状、药物-副作用等因果关系,加速知识库构建与临床决策支持。在金融风控领域,CauseEffectPairs基准训练的方法可用于分析经济变量间的因果方向,辅助投资决策。在新闻事件分析中,Event StoryLine数据集支持从新闻报道中自动提取事件发展脉络,生成因果故事线,应用于舆情监控与情报分析。此外,IHDP和Twins数据集常用于评估因果效应估计方法在政策评估、医疗干预效果分析等场景中的表现。
数据集最近研究
最新研究方向
在因果推断与自然语言处理交叉领域,该数据集汇编为前沿研究提供了系统性基准。当前热点方向聚焦于利用SemEval系列任务(如2010年任务8的因果关系分类)和COPA常识推理挑战,推动因果事件抽取与反事实推理的深度学习建模。尤其值得关注的是,结合TimeBank语料的因果标注(CausalTB)和BioCausal生物医学数据集,研究者正探索从非结构化文本中自动提取因果对,并应用于情感分析、事件剧情生成等下游任务。这些资源不仅支撑了因果图构建与可解释AI的突破,更在COVID-19舆情监测、临床决策支持等真实场景中展现出关键价值,标志着因果语言理解从规则匹配向神经符号系统的范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务