遇见数据集

Awesome-LLM-Causal-Reasoning

收藏
github2026-06-01 更新2026-06-04 收录
官方服务:

资源简介:

该合集是一个关于大型语言模型(LLM)因果推理的数据集资源集合,涵盖了因果发现、因果推断和其他因果任务等多个类别,旨在整理和索引相关领域的研究数据集,为LLM因果推理研究提供数据资源参考。

This collection is a curated set of dataset resources dedicated to causal reasoning with Large Language Models (LLMs). It encompasses multiple categories including causal discovery, causal inference, and other causal-related tasks, with the aim of organizing and indexing research datasets in this domain and providing data resource references for studies on LLM-based causal reasoning.

创建时间:
2024-08-31
原始信息汇总

数据集概述

该页面是一个关于大型语言模型(LLM)因果推理的综合资源仓库,提供了对现有研究的系统梳理,并包含用于评估LLM因果推理能力的多个数据集。数据集根据任务目标分为三大类:因果发现(Causality Discovery)因果推断(Causal Inference)其他因果任务(Additional Causal Tasks)

1. 因果发现(Causality Discovery)

此类数据集专注于从文本或数据中识别变量之间的因果关系。

数据集名称 相关论文 发表会议
Can large language models infer causation from correlation 论文链接 ICLR 2024
CausalQA 论文链接 ACL 2022
e-CARE 论文链接 ACL 2022
CausaLM 论文链接 ACL 2021

2. 因果推断(Causal Inference)

此类数据集用于评估模型对因果效应进行量化或反事实推理的能力。

数据集名称 相关论文 发表会议
CRAB 论文链接 EMNLP 2023
CLadder 论文链接 NeurIPS 2023
COLA 论文链接 ACL 2023
Abductive Commonsense Reasoning 论文链接 ICLR 2020

3. 其他因果任务(Additional Causal Tasks)

此类数据集涵盖时间因果推理、因果与道德判断、反事实推理等更广泛的因果任务。

数据集名称 相关论文 发表会议
TRAM 论文链接 ACL 2024
MoCa 论文链接 NeurIPS 2023
CRASS 论文链接 LREC 2022

评估与使用方法

作者使用 pass@1 准确率对多个最新的LLM在上述数据集上进行了评估,评估策略包括:

  • 零样本(Zero-shot)
  • 少样本(Few-shot)
  • 直接输入/输出提示(Direct I/O Prompting)
  • 思维链(Chain-of-Thought, CoT)推理

复现与探索步骤:

  1. 复现结果:进入 src 目录,运行 eval_all.py 脚本。
  2. 查看原始数据:在 llm_result 文件夹中查找结果文件,文件命名格式为 {Model_name}_{seed}_{sample_num}_{few_shot}_{direct_io}.json
  3. 探索数据集:进入 dataset/{dataset_name} 文件夹。
  4. 查看提示词:检查 prompt/{dataset_name} 文件夹。
  5. 查看合并结果:在 result 文件夹中。
  6. 加速运行:执行 run_all.sh 脚本。
搜集汇总
数据集介绍
Awesome-LLM-Causal-Reasoning 数据集图片
构建方式
该数据集构建于对大型语言模型(LLM)在因果推理领域研究的系统性梳理之上。研究者首先将现有方法按照LLM扮演的角色——作为推理引擎或作为辅助工具——进行二分法归类,并在此基础上,进一步将下游任务划分为因果发现、因果推断和附加因果任务三大类。针对每一类别,采用零样本、少样本、直接输入输出提示以及思维链推理等多种策略,以pass@1准确率作为评估指标,对近期主流LLM进行标准化评测。所有原始评测结果均以JSON格式存储,文件命名遵循'{模型名}_{种子}_{样本数}_{少样本}_{直接输入输出}.json'的规范,便于复现与扩展。
特点
该数据集的核心特色在于其多维度的分类体系与精细化的评估框架。它不仅从方法论角度区分了LLM作为独立推理引擎与作为传统因果方法辅助工具两种范式,还从任务类型角度覆盖了因果结构学习、因果效应估计及反事实推理等关键方向。通过统一采用pass@1准确率并结合多种提示策略,数据集能够全面揭示不同LLM在因果推理能力上的差异与局限性。此外,数据集附带详尽的雷达图可视化,直观呈现各模型在不同子任务上的表现分布,为后续研究提供了清晰的参照基准。
使用方法
使用该数据集时,用户首先需进入'src'目录,运行'eval_all.py'脚本以复现模型评测结果,或直接查阅'llm_result'文件夹中的原始JSON数据。各数据集的具体内容存放于'dataset/{数据集名称}'文件夹内,对应的提示模板则位于'prompt/{数据集名称}'文件夹中。合并后的评测结果可在'result'文件夹中找到。为加速批量处理,用户可直接执行'run_all.sh'脚本。该流程设计简洁高效,既支持从零开始的完整复现,也允许研究者直接利用已有结果进行深入分析,极大降低了使用门槛。
背景与挑战
背景概述
因果推理是人工智能迈向类人智能的关键能力,近年来,随着大型语言模型的迅猛发展,如何赋予其稳健的因果推理能力成为学界瞩目的前沿方向。该数据集诞生于2024年,由Longxuan Yu、Delin Chen等研究者联合发布,并被NAACL 2025收录。其核心研究问题在于系统性地审视和提升LLM在因果发现、因果推断及相关任务上的表现。通过构建CausalEval基准,该工作首次将LLM的角色明确区分为推理引擎与辅助工具,并基于多维度评估揭示了现有模型在因果推理中的局限性。这一工作为后续研究提供了重要的评估框架与方向指引,推动了因果推理与大语言模型交叉领域的深入发展。
当前挑战
该领域面临的核心挑战首先在于因果推理任务本身的复杂性:模型需从相关性中辨识因果关系,并应对反事实推理、干预推断等深层逻辑问题,这对LLM的符号化与结构化推理能力提出了极高要求。其次,构建过程中遇到的挑战尤为显著:现有数据集多聚焦于单一因果任务,缺乏统一、多维的评估体系;同时,不同因果任务之间的语义鸿沟与标注难度使得数据构建极为耗时耗力。此外,LLM在因果推理中常表现出对表面特征的依赖与逻辑一致性的缺失,如何设计有效的提示策略与评估指标以准确衡量其真实因果理解能力,仍是亟待攻克的难题。
常用场景
经典使用场景
在因果推理与大型语言模型交叉研究的蓬勃浪潮中,Awesome-LLM-Causal-Reasoning数据集应运而生,成为评估和提升语言模型因果推理能力的标杆性资源。其最经典的使用场景聚焦于因果发现与因果推断两大核心任务:研究者可借助该数据集,系统性地检验LLM在从相关性中甄别因果关系、回答反事实问题、以及构建因果结构图等方面的表现。通过零样本、少样本及思维链等提示策略,该数据集为量化模型在复杂因果情境下的推理精度提供了标准化测试平台,从而推动了因果推理在自然语言处理领域的深度整合。
实际应用
在实际应用中,该数据集所承载的因果推理能力正逐步渗透至多个高价值领域。在医疗诊断辅助系统中,利用LLM的因果理解力可从病历描述中推断症状与疾病的因果关系,提升诊断建议的可信度;在金融风控场景里,模型能够基于因果推断识别市场波动中的关键驱动因素,辅助决策者制定更稳健的投资策略;此外,在自动驾驶的常识推理模块中,该数据集训练的模型可更准确地预测交通事件的前因后果,增强系统的安全性。这些应用不仅验证了因果推理从学术研究走向产业落地的可行性,也彰显了其在提升AI系统透明性与可靠性方面的核心价值。
衍生相关工作
围绕该数据集,学术界涌现了一系列富有启发性的衍生工作。其中,CausalEval作为配套基准研究,系统刻画了不同规模LLM在因果任务上的表现差异,并提出了针对性的优化路径。CLadder工作则构建了层次化因果推理测试集,深入剖析模型在反事实与干预推理中的认知边界。CausalQA与e-CARE等数据集从因果问答与可解释因果推理角度拓展了评估维度,而CausalBERT则探索了以最小监督注入因果知识到预训练模型的新范式。这些工作共同编织了一张从数据集构建、模型评估到能力增强的完整研究网络,持续推动着因果推理与语言模型融合的前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务