遇见数据集

length-confound-benchmark

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

该数据集为审计幻觉检测器而预计算,旨在解决长度混淆问题。数据包含从残差流中提取的隐藏状态和衍生特征,以支持快速复现审计实验(下载后可在1小时内完成,而从头计算前向传播需要约30小时)。数据集涵盖了17种条件,包括论文中原始13种条件和审稿期间增加的4种(Qwen和Mistral在HaluEval和NQ-Open上的结果),但Llama-3在TruthfulQA上的数据未包含。数据文件包括:`{model}_{dataset}_rtraj_features.npz`(包含标签、响应、问题、推理投影等特征)、`{model}_{dataset}_rtraj_hidden.npz`(隐藏状态,形状为(N, L+1, D),总大小约22GB)、`{model}_reasoning_subspace.npz`(推理子空间分解结果)、`selfcheck/`和`semantic_entropy/`(缓存检测器分数)、`phase3/`、`phase4/`、`phase3_rebuttal/`(每折AUROC结果)。此外,`phase3/phase3_main_results.json`文件存储了所有检测器、条件和评估模式的每折AUROC,可直接用于生成表格1至5,而表格1和仅长度基线仅需特征文件中的`labels`和`responses`。

This dataset is precomputed for auditing hallucination detectors, aiming to address the length confusion problem. The data includes hidden states and derived features extracted from the residual stream to support fast reproduction of auditing experiments. The dataset covers 17 conditions, including the original 13 conditions from the paper and 4 added during the review process. Data files include feature files, hidden state files, reasoning subspace decomposition results, and cached detector scores.

创建时间:
2026-08-03
原始信息汇总

length-confound-benchmark 数据集详情

数据集概述

该数据集为长度混淆审计(length-confound audit) 的预计算基准数据,用于评估幻觉检测器(hallucination detectors)的性能。数据集中包含预计算的残差流(residual-stream)隐藏状态及派生特征,支持在下载后将审计流程在一小时内重新运行,而无需进行约30小时的正向传播重建。

数据内容

1. 轨迹特征文件(rtraj_features)

  • 格式:{model}_{dataset}_rtraj_features.npz
  • 覆盖:17种条件
  • 包含键(Key):
    • labels(标签)
    • responses(响应)
    • questions(问题)
    • proj_h_reasoningproj_a_reasoningproj_m_reasoning(推理相关投影)
    • reasoning_dim(推理维度)

2. 轨迹隐藏状态文件(rtraj_hidden)

  • 格式:{model}_{dataset}_rtraj_hidden.npz
  • 覆盖:17种条件,总计约22 GB
  • 包含键(Key):hidden_states,形状为 (N, L+1, D)

3. 推理子空间文件

  • 格式:{model}_reasoning_subspace.npz(共3个文件)
  • 包含键(Key):V_Rsingular_values(奇异值)、semantic_dim(语义维度)、reasoning_dim(推理维度)

4. 检测器得分缓存

  • selfcheck/:自检查(SelfCheck)得分缓存
  • semantic_entropy/:语义熵(Semantic Entropy)得分缓存
  • 适用范围:六个闭卷(closed-book)条件

5. 结果文件

  • phase3/phase4/phase3_rebuttal/:按折(per-fold)计算的AUROC结果

条件覆盖

数据集中包含论文中的13种条件,并在评审期间新增了4种条件(Qwen和Mistral在HaluEval和NQ-Open上的结果)。Llama-3在TruthfulQA上的结果未包含在该数据集中。

无需隐藏状态的复现

  • 文件 phase3/phase3_main_results.json 中存储了所有检测器、条件和评估模式的折级AUROC值。
  • 从代码仓库运行 analysis/build_tables.py 可仅基于该文件重新生成论文中的表1至表5
  • 表1和仅长度下限(length-only floor)的计算仅需特征文件中的 labelsresponses 字段。
搜集汇总
数据集介绍
length-confound-benchmark 数据集图片
构建方式
该数据集通过预计算残差流隐藏状态及衍生特征构建,旨在审计幻觉检测器。构建过程涵盖了17种实验条件,包括论文中的13种及评审期间新增的4种,涉及Qwen和Mistral模型在HaluEval和NQ-Open数据集上的表现。数据以npz格式存储,包含标签、响应、问题、投影特征及隐藏状态等关键信息,其中隐藏状态文件总计约22GB。此外,还提供了推理子空间、检测器评分及逐折AUROC结果,确保数据全面且可复现。
特点
数据集的核心优势在于其高效的审计流程,下载后可在不到一小时内完成重新运行,而从头构建需约30小时的前向传播。数据包含了丰富的特征维度,如推理子空间、语义维度等,支持多种幻觉检测器的评估。特别地,数据集覆盖了闭卷条件下的六种检测器评分,并提供了分阶段的AUROC结果,便于深入分析。尽管Llama-3在TruthfulQA上的数据未包含,但整体设计确保了跨模型、跨数据集的广泛适用性。
使用方法
使用该数据集时,用户可直接利用特征文件中的标签和响应进行基础分析,如复现表1及长度基线。对于更全面的评估,可通过运行代码仓库中的analysis/build_tables.py脚本,从phase3主结果文件中生成论文中的表1至表5。此外,隐藏状态文件支持自定义分析,而无需重新执行昂贵的模型前向传播。数据集设计兼顾了易用性与深度,用户可根据需求选择不同层级的数据进行探索。
背景与挑战
背景概述
随着大语言模型在各类自然语言处理任务中的广泛应用,其输出的准确性与可靠性成为研究焦点,尤其是幻觉现象(即模型生成不忠实于事实或上下文的内容)的检测与缓解。该数据集由相关研究团队于近期创建,旨在构建一个标准化的基准(length-confound audit),以系统评估现有幻觉检测器在控制回答长度条件下的性能表现。核心研究问题在于揭示检测器是否真正捕捉了语义正确性,而非受限于输出文本的长度统计特征这一潜在混杂因素。通过预计算并缓存多种主流模型(如Llama-3、Mistral等)在多个问答数据集(如TruthfulQA、HaluEval、NQ-Open)上的残差流隐藏状态和特征,该资源极大降低了重复计算成本,促进了相关领域的快速验证与模型可解释性研究,对提升生成式AI系统的可信度评估方法具有重要参考价值。
当前挑战
领域内的主要挑战在于:现有的幻觉检测方法,如基于自检(SelfCheck)或语义熵(Semantic Entropy)的评分策略,其判别力可能受到输出长度偏差的影响,导致高估对长文本的检测准确性,而忽略了对事实一致性本质的评估。构建过程中面临的挑战则涉及多模型、多数据集组合的复杂性,包括大规模隐藏状态的存储与高效访问(约22 GB数据),以及确保不同实验条件下评测指标的可复现性。此外,由于完整重建数据需要约30小时的模型前向传播,研究者通过缓存中间结果来平衡成本与效率,这要求对数据格式、关键字段(如语义子空间投影)进行精细设计,以支持多种分析模式的灵活切换,同时需谨慎处理因条件增补(如评审阶段新增模型)带来的数据一致性维护问题。
常用场景
经典使用场景
该数据集的核心价值在于为幻觉检测器的审计提供预计算的残差流隐状态及衍生特征,其典型使用场景是复现论文中的基准实验。研究者可借助存储的隐藏状态与特征文件,在不足一小时内完成对17种条件下各类检测器性能的重新评估,而无需耗时约30小时的前向传播计算。该数据集尤其适用于验证长度混淆效应对检测器鲁棒性的影响,通过比对不同模型与数据集组合下的AUROC指标,深入剖析检测器在区分事实性内容与长度偏差时的表现。
实际应用
在实际应用中,该数据集可辅助开发与部署高鲁棒性的幻觉检测系统,尤其是在开放域问答和事实核查场景中。工程师可利用其预计算特征快速筛选对长度变化不敏感的检测方案,降低因响应风格差异导致的误判风险。同时,数据集中包含的selfcheck与semantic_entropy等检测器分数,为生产环境中的基线选择提供了直接参照,支持在有限计算资源下进行快速模型迭代与验证。该资源亦适用于监控部署后模型行为漂移,确保长文本生成场景下的可靠性。
衍生相关工作
该数据集的发布催生了若干后续研究方向,包括对推理维度子空间分析方法论的延展,以及基于跨模型、跨数据集评测框架的扩展应用。后续工作可能利用其公开的奇异值与语义维度信息,探索不同损失函数或解码策略对幻觉率的长尾影响。此外,围绕该benchmark展开的对抗性讨论促成了对评测指标设计的新思考,例如引入长度匹配对照或因果干预手段来提升检测器评估的纯净性,相关思路已逐渐融入新一代幻觉评测基准的构建之中。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务