length-confound-benchmark
收藏资源简介:
该数据集为审计幻觉检测器而预计算,旨在解决长度混淆问题。数据包含从残差流中提取的隐藏状态和衍生特征,以支持快速复现审计实验(下载后可在1小时内完成,而从头计算前向传播需要约30小时)。数据集涵盖了17种条件,包括论文中原始13种条件和审稿期间增加的4种(Qwen和Mistral在HaluEval和NQ-Open上的结果),但Llama-3在TruthfulQA上的数据未包含。数据文件包括:`{model}_{dataset}_rtraj_features.npz`(包含标签、响应、问题、推理投影等特征)、`{model}_{dataset}_rtraj_hidden.npz`(隐藏状态,形状为(N, L+1, D),总大小约22GB)、`{model}_reasoning_subspace.npz`(推理子空间分解结果)、`selfcheck/`和`semantic_entropy/`(缓存检测器分数)、`phase3/`、`phase4/`、`phase3_rebuttal/`(每折AUROC结果)。此外,`phase3/phase3_main_results.json`文件存储了所有检测器、条件和评估模式的每折AUROC,可直接用于生成表格1至5,而表格1和仅长度基线仅需特征文件中的`labels`和`responses`。
This dataset is precomputed for auditing hallucination detectors, aiming to address the length confusion problem. The data includes hidden states and derived features extracted from the residual stream to support fast reproduction of auditing experiments. The dataset covers 17 conditions, including the original 13 conditions from the paper and 4 added during the review process. Data files include feature files, hidden state files, reasoning subspace decomposition results, and cached detector scores.
length-confound-benchmark 数据集详情
数据集概述
该数据集为长度混淆审计(length-confound audit) 的预计算基准数据,用于评估幻觉检测器(hallucination detectors)的性能。数据集中包含预计算的残差流(residual-stream)隐藏状态及派生特征,支持在下载后将审计流程在一小时内重新运行,而无需进行约30小时的正向传播重建。
数据内容
1. 轨迹特征文件(rtraj_features)
- 格式:
{model}_{dataset}_rtraj_features.npz - 覆盖:17种条件
- 包含键(Key):
labels(标签)responses(响应)questions(问题)proj_h_reasoning、proj_a_reasoning、proj_m_reasoning(推理相关投影)reasoning_dim(推理维度)
2. 轨迹隐藏状态文件(rtraj_hidden)
- 格式:
{model}_{dataset}_rtraj_hidden.npz - 覆盖:17种条件,总计约22 GB
- 包含键(Key):
hidden_states,形状为 (N, L+1, D)
3. 推理子空间文件
- 格式:
{model}_reasoning_subspace.npz(共3个文件) - 包含键(Key):
V_R、singular_values(奇异值)、semantic_dim(语义维度)、reasoning_dim(推理维度)
4. 检测器得分缓存
selfcheck/:自检查(SelfCheck)得分缓存semantic_entropy/:语义熵(Semantic Entropy)得分缓存- 适用范围:六个闭卷(closed-book)条件
5. 结果文件
phase3/、phase4/、phase3_rebuttal/:按折(per-fold)计算的AUROC结果
条件覆盖
数据集中包含论文中的13种条件,并在评审期间新增了4种条件(Qwen和Mistral在HaluEval和NQ-Open上的结果)。Llama-3在TruthfulQA上的结果未包含在该数据集中。
无需隐藏状态的复现
- 文件
phase3/phase3_main_results.json中存储了所有检测器、条件和评估模式的折级AUROC值。 - 从代码仓库运行
analysis/build_tables.py可仅基于该文件重新生成论文中的表1至表5。 - 表1和仅长度下限(length-only floor)的计算仅需特征文件中的
labels和responses字段。




