遇见数据集

counterfactual-investigations-data

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

Counterfactual Investigations数据集是论文《利用反事实调查解释模型在现实世界中的行为》的配套数据集,旨在支持反事实调查方法,通过调查代理对目标模型在真实聊天和代理提示下的行为进行解释。调查代理通过运行针对目标模型的反事实实验,生成可验证的二元反事实声明(例如:如果提示按X方式改变,行为将按Y方式改变),并由评估代理根据预测这些声明的真伪标签进行评分。数据集包含所有已发布调查运行的每个流水线阶段数据(包括补全、筛选、调查、验证)、衍生的声明评估数据集、SFT训练数据以及提示数据集。每个调查的完整反事实实验日志和书面报告都保存在`investigations.jsonl`文件中。数据集规模约93GB,分为评估运行和训练运行两大类,针对多个目标模型(如Qwen3-8B、Qwen3-32B、Qwen3.5-397B、Qwen3.6-35B-A3B、Gemma 3 27B、Llama 3.1 8B)构建。数据来源于WildChat+代理提示池和Petri对齐审计转录本。该数据集适用于模型可解释性、模型理解、反事实推理、行为评估等研究任务,并为训练反事实预测模型和自解释模型提供数据支持。

The Counterfactual Investigations dataset is a companion dataset for the paper Explaining Model Behavior in the Real World through Counterfactual Investigations. It aims to support counterfactual investigation methods by explaining the behavior of target models in real-world chat and agent prompts through investigation agents. The investigation agents run counterfactual experiments on target models to generate verifiable binary counterfactual claims (e.g., if the prompt is changed in X way, the behavior will change in Y way), which are then scored by evaluation agents based on predicting the truth labels of these claims. The dataset includes data from all published investigation runs for each pipeline stage (completion, filtering, investigation, validation), derived claim evaluation datasets, SFT training data, and prompt datasets. Complete counterfactual experiment logs and written reports for each investigation are stored in `investigations.jsonl`. The dataset size is approximately 93GB, divided into evaluation runs and training runs, and is built for multiple target models (including Qwen3-8B, Qwen3-32B, Qwen3.5-397B, Qwen3.6-35B-A3B, Gemma 3 27B, Llama 3.1 8B). Data sources include the WildChat+ agent prompt pool and Petri alignment audit transcripts. The dataset is suitable for research tasks such as model interpretability, model understanding, counterfactual reasoning, behavior evaluation, and provides data support for training counterfactual prediction models and self-explaining models.

创建时间:
2026-07-20
原始信息汇总

数据集概述

该数据集为论文 "Explaining Model Behaviors in the Wild with Counterfactual Investigations" 的配套数据集,用于研究如何通过反事实实验解释目标模型在真实聊天/智能体提示下的行为。

核心思想

一个调查智能体(Investigator Agent)通过针对目标模型运行反事实实验,解释目标模型(如 Qwen3-8B、Qwen3-32B、Qwen3.5-397B、Qwen3.6-35B-A3B、Gemma 3 27B、Llama 3.1 8B)在真实聊天/智能体提示下的行为。已验证的解释被转化为二进制反事实声明(“如果提示按X方式改变,行为将按Y方式改变”),评估智能体(无论是否使用工具,如激活神谕、NLA、SAE)根据预测每个声明的真/假标签进行评分。

数据集构成

数据集包含每次已发布调查运行的每个管道阶段(完成、筛选、调查、验证)、衍生声明评估数据集、SFT训练数据和提示数据集。每个调查的完整反事实实验日志和书面报告均保存在 investigations.jsonl 中。

  • 总大小: 约 93 GB
  • 数据格式: JSONL(每行一个 JSON 记录)
  • 代码仓库: https://github.com/adamkarvonen/counterfactual-investigations
  • 模型仓库: https://huggingface.co/adamkarvonen

文件夹命名与布局

数据文件夹结构为 datasets/<name>/prompt_sources/<name>/,命名规则为 {target}_{source}_{split}

  • target: 被调查模型,包括 qwen3_8bqwen3_32bqwen3p5_397bqwen3p6_35b_a3bgemma3_27b_itllama3_1_8b
  • source: 提示池,包括 wildchat(WildChat + 智能体切片)或 petri(对齐审计转录)。
  • split: eval(每个提示 30 次完成,保留评估运行)或 train(每个提示 10 次完成,SFT 规模训练运行)。
  • _thinking 目标模型以推理模式运行(思考预算 1024)。
  • self_investigate 目标模型自我调查(调查者 = 评判者 = 目标模型)。

每个文件夹均包含 MANIFEST.txt(文件、字节、JSONL 文件行数,上限 2 GiB)。

评估运行(每个提示 30 次完成,Claude Opus 4.6 调查者)

文件夹 目标模型 提示来源 调查数 声明库 评估集 大小
gemma3_27b_it_wildchat_eval google/gemma-3-27b-it WildChat+agentic (5000) 1,987 4,813 1,750 3.1G
qwen3_8b_wildchat_eval Qwen/Qwen3-8B WildChat+agentic (5000) 1,906 4,389 2,000 2.8G
qwen3_8b_petri_eval Qwen/Qwen3-8B Petri (8B audit, 2061) 868 2,125 1,442 1.2G
qwen3p5_397b_wildchat_eval Qwen/Qwen3.5-397B-A17B-FP8 WildChat+agentic (5000) 1,778 4,370 1,396 2.9G
qwen3p5_397b_petri_eval Qwen/Qwen3.5-397B-A17B-FP8 Petri (397B audit, 1732) 547 1,322 708 951M
qwen3_32b_wildchat_eval Qwen/Qwen3-32B-FP8 WildChat+agentic (5000) 1,571 2.4G
llama3_1_8b_wildchat_eval meta-llama/Llama-3.1-8B-Instruct WildChat+agentic (5000) 1,906 4,300 1,798 2.8G
qwen3_8b_wildchat_thinking_eval Qwen/Qwen3-8B (thinking 1024) WildChat+agentic (5000) 1,573 3,798 1,872 6.8G
qwen3p5_397b_wildchat_thinking_eval Qwen/Qwen3.5-397B-A17B-FP8 (thinking 1024) WildChat+agentic (5000) 954 2,318 928 5.9G

所有 WildChat 评估运行均使用相同的 prompt_sources/prompts_wildchat_agentic/prompts.jsonl 的前 5000 条切片(偏移量为 0)。

每个文件夹的文件:

  • config.json:完整运行来源信息
  • prompts.jsonl:输入提示
  • completions.jsonl:目标模型完成(每个提示 30 个样本)
  • screening.jsonl:阶段 2 筛选
  • investigations.jsonl:调查者发现(包含完整实验日志和书面报告)
  • verification.jsonl:独立的 5 名评判者验证
  • binary_counterfactual_questions.jsonl:衍生声明库
  • mechanism_concreteness.jsonl:每个调查的具体性标签
  • eval_set_conc3_n2000.jsonl:论文中使用的平衡评估集(具体性 >= 3 的声明,上限 2000)

训练运行(每个提示 10 次完成)

文件夹 目标模型 调查者 调查数 声明库 大小
qwen3_8b_wildchat_train Qwen/Qwen3-8B Claude Opus 4.6 21,780 52,561 6.1G
qwen3_32b_wildchat_train Qwen/Qwen3-32B (fp8) Claude Opus 4.6 39,946 81,769 12G
llama3_1_8b_wildchat_train meta-llama/Llama-3.1-8B-Instruct Claude Opus 4.6 15,299 34,218 4.2G
qwen3p5_397b_wildchat_self_investigate_train Qwen/Qwen3.5-397B-A17B-FP8 目标自身 50,508 69,485 16G
qwen3p6_35b_a3b_wildchat_self_investigate_train Qwen/Qwen3.6-35B-A3B-FP8 目标自身 65,464 25G

每个文件夹的文件:

  • investigations.jsonlscreening.jsonlverification.jsonl:与评估运行记录模式相同
  • binary_counterfactual_questions.jsonl:声明库
  • provenance_config.json:原始管道运行配置

提示来源

文件夹 内容 提示数 大小
prompts_wildchat_agentic prompts.jsonl — 评估提示池(WildChat 4.8M 单轮聊天 + Hermes/ToolACE/SystemChat 智能体提示) 189,542 711M
prompts_wildchat_172k prompts.jsonl — 较大的 WildChat 训练提示池 172,332 660M

记录模式:{conversation_hash, messages, user_message, n_turns, total_chars, id, source}

记录模式摘要

  • investigations.jsonl 包含 prompt_idinterest_scorebehavior_summaryquestionsuggested_counterfactualuser_messagecompletionsinvestigation_reportexperiment_logstructured_findings 等字段。
  • screening.jsonl 包含 promptcompletionsinterest_scorescreening_rationale 等字段。
  • verification.jsonl 包含 prompt_idscore (1-10)experiment_assessmentsexplanation_assessment 等字段。
  • binary_counterfactual_questions.jsonl 包含 datasetsource_runprompt_idquestiontranscriptstatementis_trueclaim_type 等字段。
  • mechanism_concreteness.jsonl 包含 prompt_idmechanism_concreteness (1-5)categoriesis_mistakerationale 等字段。

已发布模型

论文中的训练检查点以 LoRA 适配器形式发布,基于以下基础模型:

仓库 基础模型 说明
qwen3_8b_counterfactual_e1_kl0 Qwen/Qwen3-8B 主要反事实预测模型
qwen3_8b_counterfactual_e1_kl1 Qwen/Qwen3-8B 同上,带 KL 惩罚
qwen3_8b_selfexpl_structured_e3_kl0 Qwen/Qwen3-8B 自由格式结构化自我解释
qwen3_8b_selfexpl_first_person_e3_kl0 Qwen/Qwen3-8B 第一人称段落自我解释
qwen3_32b_selfexpl_structured_e3_kl0 Qwen/Qwen3-32B 32B 自由格式结构化自我解释
qwen3_32b_selfexpl_synth_e1_kl1 Qwen/Qwen3-32B 32B 合成混合模型
qwen3p5_397b_counterfactual_e1_kl0 Qwen/Qwen3.5-397B-A17B 397B 反事实预测
qwen3p5_397b_selfexpl_e3_kl0 Qwen/Qwen3.5-397B-A17B 397B 自由格式自我解释

许可、来源与归属

该数据集根据混合条款发布,源自多个上游来源,每个来源保留其自身许可:

组件 来源 上游许可/条款
WildChat 提示及其衍生内容 allenai/WildChat-4.8M ODC-BY 1.0 — 需注明 AI2/allenai
智能体提示池 NousResearch/hermes-function-calling-v1Team-ACE/ToolACEcognitivecomputations/SystemChat-2.0 Apache-2.0
Petri 评估转录 safety-research/petri MIT
Qwen 目标完成/调查 Qwen 相关模型 Apache-2.0
Llama 目标完成 Meta Llama-3.1-8B-Instruct Llama 3.1 Community LicenseBuilt with Llama
Gemma 目标完成 Google Gemma-3-27b-it Gemma Terms of Use + Gemma Prohibited Use Policy
调查者/验证者/评判者输出 Claude Opus 4.6 (Anthropic) Anthropic Commercial Terms;输出不得用于训练竞争模型

加载方式

通过代码仓库重建数据布局:

bash git clone https://github.com/adamkarvonen/counterfactual-investigations cd counterfactual-investigations pip install -e . python scripts/download_data.py

或通过 huggingface_hub 下载单个文件夹:

python from huggingface_hub import snapshot_download

path = snapshot_download( repo_id="adamkarvonen/counterfactual-investigations-data", repo_type="dataset", allow_patterns=["datasets/qwen3_8b_wildchat_eval/**"], )

或通过 datasets 库直接流式加载单个文件:

python from datasets import load_dataset

ds = load_dataset( "json", data_files="hf://datasets/adamkarvonen/counterfactual-investigations-data/" "datasets/qwen3_8b_wildchat_eval/eval_set_conc3_n2000.jsonl", split="train", )

搜集汇总
数据集介绍
counterfactual-investigations-data 数据集图片
构建方式
该数据集源于论文《Explaining Model Behaviors in the Wild with Counterfactual Investigations》所提出的可解释性研究范式,旨在通过反事实实验揭示大语言模型在真实对话与智能体场景中的行为机理。研究者构建了一个名为“调查者”(Investigator)的智能体,对目标模型(涵盖Qwen3系列、Gemma 3 27B、Llama 3.1 8B等)的实际输出行为展开系统性质询,通过生成反事实输入扰动(prompt编辑)并观察模型输出的变化,形成二值化的反事实断言。随后,这些断言经独立五裁判机制验证,转化为带有真值标签的评估样本,并进一步衍生出机制具体性标注、平衡评估集与有监督微调训练数据。数据集按目标模型、提示来源及实验拆分组织为标准化文件夹,内部包含完整的流水线产物:从原始补全、兴趣筛选、调查日志、验证记录到最终断言库,每一阶段的数据皆以JSONL格式留存,并附有配置文件与清单文件确保可复现性。
特点
该数据集具备显著的结构化与多层次特征。首先,其构建过程并非简单收集反事实样本,而是模拟了完整的科研调查流水线:筛选值得关注的模型行为,设计针对性干预实验,记录逐实验的补全与判决结果,最终提炼为逻辑明确的因果断言。每个断言均包含原始提示、干预方式、基线与反事实条件下的模型输出分布、效应量及真值标签,并区分真伪变体,为细粒度的因果推理评估提供了条件。其次,数据集覆盖了多个主流开放权重模型(包括推理与非推理模式)以及真实世界提示来源(WildChat、Petri),规模达数十万条调查记录与近二十万条断言。更独特的是,部分运行采用了“自我调查”模式,让目标模型自身作为调查者,为研究模型内省能力与忠实思维链提供了稀缺资源。此外,训练与评估拆分的严格隔离、机制具体性等级标注及跨模型一致性提示池设计,使其成为因果可解释性研究的高质量基准。
使用方法
用户可通过多路径灵活利用该数据集。推荐方式为克隆配套代码仓库,运行下载脚本以重构符合流水线预期的目录结构,从而直接加载完整运行文件夹,包括补全、筛选、调查与验证记录,以及标准化的断言库与评估集。对于需要快速访问特定子集的场景,可利用Hugging Face Hub的snapshot_download功能按正则模式过滤下载,或通过datasets库流式读取单一JSONL文件,无需本地完整存储。数据集已预构建平衡评估集(评分≥3且规模上限2000),适用于直接评估可解释性工具或反事实预测模型的性能。训练运行文件夹提供了大规模监督微调数据,可配对发布的开源LoRA适配器(涵盖反事实预测与自由形式自解释两类任务),用于训练或评估模型对自身行为的因果理解能力。所有数据以JSONL格式记录,字段完整注释,便于自定义解析与下游实验集成。
背景与挑战
背景概述
在大型语言模型(LLM)可解释性领域,如何精确揭示模型在真实对话与智能体(agentic)场景中的决策动因,始终是核心研究难题。为此,Adam Karvonen等人于2025年构建了Counterfactual Investigations数据集,通过反事实实验框架系统性地探究Qwen3-8B、Qwen3-32B、Qwen3.5-397B、Gemma3-27B及Llama3.1-8B等多种主流模型的行为机制。该数据集的核心创新在于引入自主调查智能体(investigator agent),针对模型在WildChat等实际提示上的输出,设计精心构造的反事实编辑,将模型行为变化转化为二值因果断言,并经由多轮验证生成可检验的标注数据。其研究范式突破了传统静态评估的局限,为理解大模型的真实推理逻辑提供了可量化的分析工具,对推动可解释性评估方法的发展具有里程碑意义。
当前挑战
该数据集面临的核心挑战首先在于领域问题层面:现有可解释性工具如激活或acles、神经网络语言分析(NLA)及稀疏自编码器(SAE)在预测二值反事实断言的真假标签时,缺乏统一的评估标准与可靠的对照基线,且不同工具在跨模型泛化时的性能差异显著。其次,在构建过程中,反事实干预的设计面临编辑清洁度(edit cleanliness)与因果清洁性平衡的难题——不自然的扰动可能导致模型产生无关行为偏移,而细微的语法变化又难以触发有意义的因果效应。此外,高达数百GB的异构数据(包含完整调查管道日志、多轮验证结果及多源提示池)的标准化存储与高效检索,以及Llama、Gemma等模型输出所附带的混合许可合规管理,亦对数据集的可用性构成严峻挑战。
常用场景
经典使用场景
在可解释人工智能(XAI)这一蓬勃发展的研究领域中,反事实解释已成为揭示黑箱模型行为机理的核心范式。Counterfactual Investigations数据集为研究者提供了一个系统化的实验平台,其经典使用场景在于通过反事实实验来剖析大语言模型在真实对话与智能体交互中的行为动因。具体而言,研究者可借助该数据集中的完整流水线——涵盖目标模型输出采集、行为筛选、反事实探针设计、独立验证及二元反事实断言生成——来系统性地回答特定提示扰动如何改变模型输出。该数据集覆盖了Qwen3-8B、Llama 3.1 8B、Gemma 3 27B等多个主流开源模型在数千条实际对话上的完整反事实实验日志,为理解模型在自然语境下的决策逻辑提供了前所未有的细粒度观测窗口。
解决学术问题
该数据集精准回应了当前大语言模型可解释性研究中一个悬而未决的核心挑战:如何在非受限的真实场景中而非人为构造的实验室环境中,对模型行为进行因果层面的归因与验证。通过提供大量经过实际模型验证的二元反事实断言('若提示按某种方式改变,则行为会按某种方式改变'),该数据集使学术界得以系统性地评估各类解释方法——包括激活探针、潜在语言分析、稀疏自编码器等——在预测模型行为变化上的真实效力。其深远意义在于,该工作将模型理解从描述性关联推向因果推断这一更严谨的认知层次,不仅为衡量解释方法的可靠性设立了基于行为预测准确率的量化基准,更通过揭示模型在反事实条件下的思维链忠诚度等问题,为构建更加透明、可信的AI系统奠定了方法论基础。
衍生相关工作
围绕该数据集已涌现出一系列推动可解释人工智能前沿发展的重要工作。最核心的衍生产品是一组经由反事实数据微调的语言模型适配器,例如Qwen3-8B的反事实预测变体能够准确判断指定提示编辑是否会导致自身行为改变,而结构化自解释模型则可生成包含行为描述、因果支持证据与最终结论的完整解释报告。这些模型在附录中展示了在保持基础能力的前提下实现准确自我解释的可能性。更进一步,跨模型反事实迁移研究——即让一个模型学习预测另一模型的行为变化——探讨了将可解释性能力转移至不透明商用模型的通路,其中尤以Llama-3.1-8B训练于Qwen3-8B反事实数据上的交叉实验最具启发性。此外,研究者还开发了基于思维链忠实的评估工具,利用推理模式下的反事实数据检测模型在解释自身推理过程时的不忠实表现,这些工作共同构筑了一个不断扩展的因果解释方法学体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务