output
收藏资源简介:
本数据集名为“人物身份偏见路径补丁电路结果”,专注于大语言模型(LLM)机制可解释性研究,特别是针对社会偏见的内部形成机制。数据集核心内容是基于路径补丁(Path-Patching)方法,在Llama-3.2-3B-Instruct模型上,系统性地探究了模型在处理不同下游任务时,所表现出的人物身份偏见(如情绪、性别、宗教、种族)与其内部计算电路(Circuit)及注意力头(Attention Heads)的关联。数据来源于在多个标准评估数据集(包括数学推理GSM8K、常识推理ARC-Easy和ARC-Challenge)上进行的可控实验,采用了两种具体的干预设置(reverse_axis100_dir20_balanced和reverse_fixed15)来实施路径补丁。数据集规模在10万至100万条记录之间,以CSV文件格式组织,包含了详细的实验输出:例如,所有注意力头在各实验阶段的影响分析(stage_*_all_heads.csv)、被识别出的关键注意力头列表(selected_heads_*.csv)、以及基于头部分组的偏见/非偏见样本分析(head_group_bias_unbias下的各类文件)。该数据集旨在为研究人员提供实证基础,用于分析LLM中社会偏见的传播路径、发现导致偏见的关键模型组件(电路与注意力头),并推动更可解释、更公平的AI模型开发。它适用于机制可解释性、算法偏见溯源、注意力头功能分析和模型电路发现等前沿研究领域。
数据集概述:Persona Bias Path-Patching Circuit Results
- 数据集名称:Persona Bias Path-Patching Circuit Results
- 许可协议:MIT
- 任务类别:其他 (other)
- 标签:bias, persona, mechanistic-interpretability, path-patching, circuit-discovery, attention-heads, llm-evaluation
- 数据集大小:100K < n < 1M
- 配置数量:多个配置,涵盖不同模型、任务、偏见类型和处理方式
数据内容与结构
该数据集包含基于 Llama-3.2-3B-Instruct 模型,在 gsm8k、arc_easy、arc_challenge 三个任务上,针对 emotion、gender、religion、race 四种偏见类型,使用 reverse_axis100_dir20_balanced 和 reverse_fixed15 两种处理方法的路径修补(path-patching)电路分析结果。
主要数据文件类型
每个配置对应一个或多个 CSV 文件,主要类型包括:
- 所有注意力头分析 (stage_1, stage_2, stage_3):例如
stage_1_emotion_all_heads.csv,记录在所有注意力头上进行的路径修补实验结果。 - 选中的注意力头 (selected_heads):例如
selected_heads_emotion.csv,聚焦于特定选中的注意力头。 - 头组偏见/无偏见分析 (head_group_bias_unbias):包含多个子集:
head_group_bias_unbias_biased_samples.csv(有偏样本)head_group_bias_unbias_unbiased_samples.csv(无偏样本)head_group_bias_unbias_by_group.csv(按组别)head_group_bias_unbias_head_sets.csv(头集合)head_group_bias_unbias_presentation_summary.csv(展示摘要)
示例配置
Llama-3.2-3B-Instruct__gsm8k__emotion__reverse_axis100_dir20_balancedLlama-3.2-3B-Instruct__arc_easy__gender__reverse_fixed15Llama-3.2-3B-Instruct__arc_challenge__race__reverse_axis100_dir20_balanced__head_group_bias_unbias
数据分割
数据分割包括:stage_1, stage_2, stage_3, train, biased_samples, unbiased_samples 等,取决于具体配置。




