concausal-news-corpus
收藏资源简介:
Concausal News Corpus是一个用于因果关系提取的英文新闻语料库,包含三个主要任务配置:因果关系检测(区分因果和非因果文本)、因果候选提取(识别文本中的因果实体)和因果关系识别(识别实体间的因果关系类型)。数据集规模在1K到10K之间,适用于文本分类和标记分类任务。该数据集基于论文《Investigating Counterclaims in Causality Extraction from Text》创建,可用于研究文本中的因果关系提取。
Concausal News Corpus is an English news corpus designed for causal relation extraction, encompassing three core task configurations: causal detection (distinguishing causal and non-causal texts), causal candidate extraction (identifying causal entities within texts), and causal relation identification (classifying the types of causal relations between entities). The corpus has a scale ranging from 1K to 10K, and is suitable for text classification and token classification tasks. This dataset was developed based on the paper *Investigating Counterclaims in Causality Extraction from Text*, and can be utilized for research on causal relation extraction from texts.
Concausal News Corpus 数据集概述
基本描述
- 数据集名称: Concausal News Corpus
- 许可证: CC BY 4.0
- 主要任务类别: 文本分类、令牌分类
- 语言: 英语
- 多语言性: 单语
- 数据规模: 1K < n < 10K
- 标签: 因果关系
数据集配置
数据集包含三个独立的配置,每个配置对应一个特定的任务。
1. 因果关系检测
- 配置名称: causality detection
- 任务类型: 文本分类
- 数据文件:
train: https://huggingface.co/datasets/thagen/concausal-news-corpus/resolve/main/causality-detection/train.parquet
- 特征:
index(字符串): 索引text(字符串): 文本label(类别标签): 标签,0代表“非因果”,1代表“因果”
- 评估指标: 准确率、精确率、召回率、F1分数
2. 因果候选抽取
- 配置名称: causal candidate extraction
- 任务类型: 令牌分类
- 数据文件:
train: https://huggingface.co/datasets/thagen/concausal-news-corpus/resolve/main/causal-candidate-extraction/train.parquet
- 特征:
index(字符串): 索引text(字符串): 文本entity(序列): 实体序列
- 评估指标: 准确率、精确率、召回率、F1分数
3. 因果关系识别
- 配置名称: causality identification
- 任务类型: 文本分类
- 数据文件:
train: https://huggingface.co/datasets/thagen/concausal-news-corpus/resolve/main/causality-identification/train.parquet
- 特征:
index(字符串): 索引text(字符串): 文本relations(列表): 关系列表,包含以下字段:relationship(类别标签): 关系类型,0代表“无关系”,1代表“正向因果”,2代表“反向因果”first(字符串): 第一个实体second(字符串): 第二个实体
- 评估指标: 准确率、精确率、召回率、F1分数
相关论文
- 标题: Investigating Counterclaims in Causality Extraction from Text
- 链接: https://arxiv.org/abs/2510.08224
引用格式
bib @article{hagen:2025, title = {Investigating {{Counterclaims}} in {{Causality Extraction}} from {{Text}}}, author = {Hagen, Tim and Deckers, Niklas and Wolter, Felix and Scells, Harrisen and Potthast, Martin}, year = 2025, journal = {CoRR}, volume = {abs/2510.08224}, eprint = {2510.08224}, doi = {10.48550/ARXIV.2510.08224}, archiveprefix = {arXiv} }




