Awesome-LLM-Causal-Reasoning
收藏资源简介:
该合集是一个关于大型语言模型(LLM)因果推理的数据集资源集合,涵盖了因果发现、因果推断和其他因果任务等多个类别,旨在整理和索引相关领域的研究数据集,为LLM因果推理研究提供数据资源参考。
This collection is a curated set of dataset resources dedicated to causal reasoning with Large Language Models (LLMs). It encompasses multiple categories including causal discovery, causal inference, and other causal-related tasks, with the aim of organizing and indexing research datasets in this domain and providing data resource references for studies on LLM-based causal reasoning.
数据集概述
该页面是一个关于大型语言模型(LLM)因果推理的综合资源仓库,提供了对现有研究的系统梳理,并包含用于评估LLM因果推理能力的多个数据集。数据集根据任务目标分为三大类:因果发现(Causality Discovery)、因果推断(Causal Inference) 和其他因果任务(Additional Causal Tasks)。
1. 因果发现(Causality Discovery)
此类数据集专注于从文本或数据中识别变量之间的因果关系。
| 数据集名称 | 相关论文 | 发表会议 |
|---|---|---|
| Can large language models infer causation from correlation | 论文链接 | ICLR 2024 |
| CausalQA | 论文链接 | ACL 2022 |
| e-CARE | 论文链接 | ACL 2022 |
| CausaLM | 论文链接 | ACL 2021 |
2. 因果推断(Causal Inference)
此类数据集用于评估模型对因果效应进行量化或反事实推理的能力。
| 数据集名称 | 相关论文 | 发表会议 |
|---|---|---|
| CRAB | 论文链接 | EMNLP 2023 |
| CLadder | 论文链接 | NeurIPS 2023 |
| COLA | 论文链接 | ACL 2023 |
| Abductive Commonsense Reasoning | 论文链接 | ICLR 2020 |
3. 其他因果任务(Additional Causal Tasks)
此类数据集涵盖时间因果推理、因果与道德判断、反事实推理等更广泛的因果任务。
评估与使用方法
作者使用 pass@1 准确率对多个最新的LLM在上述数据集上进行了评估,评估策略包括:
- 零样本(Zero-shot)
- 少样本(Few-shot)
- 直接输入/输出提示(Direct I/O Prompting)
- 思维链(Chain-of-Thought, CoT)推理
复现与探索步骤:
- 复现结果:进入
src目录,运行eval_all.py脚本。 - 查看原始数据:在
llm_result文件夹中查找结果文件,文件命名格式为{Model_name}_{seed}_{sample_num}_{few_shot}_{direct_io}.json。 - 探索数据集:进入
dataset/{dataset_name}文件夹。 - 查看提示词:检查
prompt/{dataset_name}文件夹。 - 查看合并结果:在
result文件夹中。 - 加速运行:执行
run_all.sh脚本。





