counterfactuals
收藏资源简介:
Persona Bias Counterfactuals是一个专门用于人设偏见电路发现和干预实验的反事实示例数据集。该数据集包含三个不同的大型语言模型(Llama-3.1-8B-Instruct、Llama-3.2-3B-Instruct和Qwen2.5-7B-Instruct)生成的文本数据,每个模型下提供三种反事实策略分割:axis100_dir20_balanced(论文主要使用)、original和reverse_axis100_dir20_balanced。数据以压缩的JSONL格式存储,总样本量因模型而异,分别为78,694、146,819和279,910行;按策略统计,original策略数据最多(482,001行),两个平衡策略各约11,711行。每个数据行包含丰富的元数据,如模型名称、任务类型、偏见轴、策略类型、源文件等。数据集涵盖多个核心任务(如ARC挑战/简易、伦理、安全、情感分析SST2)和偏见轴(如情感、性别、种族、宗教),适用于文本分类、机制可解释性分析、偏见检测与干预等研究场景。
Persona Bias Counterfactuals is a counterfactual example dataset designed for persona bias circuit discovery and intervention experiments. The dataset contains text data generated by three different large language models (Llama-3.1-8B-Instruct, Llama-3.2-3B-Instruct, and Qwen2.5-7B-Instruct), with each model providing three counterfactual strategy splits: axis100_dir20_balanced (primarily used in the paper), original, and reverse_axis100_dir20_balanced. The data is stored in compressed JSONL format, with total sample sizes varying by model: 78,694, 146,819, and 279,910 rows respectively; by strategy, the original strategy has the most data (482,001 rows), while the two balanced strategies each have approximately 11,711 rows. Each data row includes rich metadata, such as model name, task type, bias axis, strategy type, source file, etc. The dataset covers multiple core tasks (e.g., ARC Challenge/Easy, Ethics, Safety, Sentiment Analysis SST2) and bias axes (e.g., sentiment, gender, race, religion), making it suitable for research scenarios like text classification, mechanistic interpretability analysis, bias detection, and intervention.
数据集概述:Persona Bias Counterfactuals
该数据集用于人格偏见(persona-bias)电路发现与干预实验,包含基于反事实(counterfactual)生成的示例。
- 许可证:other(其他)
- 任务类别:文本分类(text-classification)
- 语言:英语(en)
- 标签:机制可解释性(mechanistic-interpretability)、人格偏见(persona-bias)、反事实(counterfactuals)
数据集配置与结构
数据集按模型分为三个配置,每个配置包含三个拆分(策略):
| 配置(模型) | 拆分(策略) | 数据文件路径 |
|---|---|---|
Llama-3.1-8B-Instruct |
axis100_dir20_balanced |
data/Llama-3.1-8B-Instruct/axis100_dir20_balanced.jsonl.gz |
original |
data/Llama-3.1-8B-Instruct/original.jsonl.gz |
|
reverse_axis100_dir20_balanced |
data/Llama-3.1-8B-Instruct/reverse_axis100_dir20_balanced.jsonl.gz |
|
Llama-3.2-3B-Instruct |
axis100_dir20_balanced |
data/Llama-3.2-3B-Instruct/axis100_dir20_balanced.jsonl.gz |
original |
data/Llama-3.2-3B-Instruct/original.jsonl.gz |
|
reverse_axis100_dir20_balanced |
data/Llama-3.2-3B-Instruct/reverse_axis100_dir20_balanced.jsonl.gz |
|
Qwen2.5-7B-Instruct |
axis100_dir20_balanced |
data/Qwen2.5-7B-Instruct/axis100_dir20_balanced.jsonl.gz |
original |
data/Qwen2.5-7B-Instruct/original.jsonl.gz |
|
reverse_axis100_dir20_balanced |
data/Qwen2.5-7B-Instruct/reverse_axis100_dir20_balanced.jsonl.gz |
拆分策略说明
| 拆分名称 | 含义 |
|---|---|
original |
完整原始反事实集,来源于人格扫描 |
axis100_dir20_balanced |
论文主要使用的反事实子集,受轴/方向预算限制(推荐用于主电路发现) |
reverse_axis100_dir20_balanced |
反向方向的反事实子集,用于反向电路诊断 |
数据行数
按模型统计
| 模型 | 行数 |
|---|---|
Llama-3.1-8B-Instruct |
78,694 |
Llama-3.2-3B-Instruct |
146,819 |
Qwen2.5-7B-Instruct |
279,910 |
按策略统计
| 策略 | 行数 |
|---|---|
axis100_dir20_balanced |
11,711 |
original |
482,001 |
reverse_axis100_dir20_balanced |
11,711 |
主要任务与轴
主要任务:arc_easy、arc_challenge、ethics、safety、sst2
轴(Axes):emotion、gender、race、religion
数据模式说明
- 所有直接源字段均以字符串形式存储,结构化值存储为JSON字符串。
- 完整原始行保留在
source_json字段中。 - 常见的直接列包括:
model、task、axis、strategy、counterfactual_strategy、source_file、summary_file、source_json以及sample_id、direction、clean_value、corrupt_value、clean_candidate、corrupt_candidate、clean_candidate_prediction、corrupt_candidate_prediction、clean_candidate_correct、corrupt_candidate_correct等反事实字段。
加载方式
使用 datasets 库加载,示例:
python
from datasets import load_dataset
ds = load_dataset("PersonaBias/counterfactuals", "Llama-3.2-3B-Instruct", split="axis100_dir20_balanced")
可通过 task 和 axis 列进行过滤,例如筛选取 arc_challenge 任务且轴为 emotion 的行。




