遇见数据集

Realmbird/nla-thought-anchors-hash-step2

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是NLA(自然语言自动编码器)管道nla-thought-anchors的第二步,包含Qwen2.5-7B-Instruct模型在GSM8K测试集上,于####标记处提取的第20层激活向量的自然语言描述。每个数据行包括:GSM8K数学问题文本、标准答案(含####标记)、模型生成的完整思维链和答案、模型答案是否正确、在####标记处的第20层残差流激活向量(长度为3584的浮点数列表)、在原始GSM8K测试分割中的索引,以及NLA执行器对激活向量的自然语言描述。数据集分为correct(正确示例,690条)和incorrect(错误示例,629条)两个分割,总计1319条数据。研究发现,NLA描述在正确示例中包含数字答案的比例为14.3%,表明####标记携带了有意义的答案信号。数据集适用于自然语言处理、机制可解释性等领域的研究。

This dataset is step 2 of the NLA (Natural Language Autoencoder) pipeline nla-thought-anchors, containing natural-language descriptions of Qwen2.5-7B-Instruct layer-20 activations extracted at the #### token on the GSM8K test set. Each row includes: GSM8K question text, ground-truth answer (with #### marker), full model-generated chain-of-thought and answer, whether the model answer is correct, the layer-20 residual stream activation vector at the #### token (a list of float32 with length 3584), the index in the original GSM8K test split, and the NLA actor verbalization of the activation. The dataset is split into correct (690 examples) and incorrect (629 examples) subsets, totaling 1319 examples. Findings show that the NLA description contains the numeric answer as a literal string in 14.3% of correct examples, confirming that the #### token carries meaningful answer signal. The dataset is useful for research in natural language processing and mechanistic interpretability.

提供机构:
Realmbird
搜集汇总
数据集介绍
Realmbird/nla-thought-anchors-hash-step2 数据集图片
构建方式
该数据集源于机械可解释性研究,旨在探索大语言模型在中间层残差流中编码的语义信息。其构建依托于GSM8K数学推理测试集,通过提取Qwen2.5-7B-Instruct模型在第二十层网络于特定标记符“####”处的激活向量——这一标记恰好位于模型完成所有链式推理、即将输出最终答案的临界时刻。随后,研究者借助自然语言自编码器(NLA)Actor,将原始激活向量作为单一token嵌入固定提示模板中,借助自回归生成机制将其转化为人类可读的自然语言描述,从而以跨模态方式揭示潜藏于高维空间中的模型内部表征。
特点
该数据集最显著的特点在于其独特的标记位置选择,聚焦于“####”这一答案前兆标记,而非最终数字答案本身,从而捕捉到推理完成但尚未输出答案的过渡态信息。数据集包含正确与错误两类样本,共计1319条记录,其中正确样本的NLA描述中包含答案文字的比例达14.3%,较之基于提示词提取的方案提升了18倍,有力证明了该标记位置携带丰富的预输出信号。此外,该数据集亦揭示了NLA Actor在跨分布应用时的泛化局限性,即其在竞赛数学数据上训练后,面对GSM8K日常应用题时倾向于以几何图形、谜题等词汇进行描述,为后续优化提供了方向。
使用方法
数据集可通过HuggingFace Datasets库轻松加载,用户只需调用load_dataset函数并指定数据集名称即可获取全部样本。在完成加载后,用户能够按数据划分(正确/错误)对模型响应进行差异化分析,例如遍历正确样本,输出问题原文与对应的NLA描述,以探究模型在正确推理时的内部状态。该数据集亦可与同系列的其他步骤数据(如答案标记变体)联合使用,叠加对比不同标记位置或不同层级的激活表征,从而系统性地剖析大模型在数学推理任务中的信息流动与表征演变模式。
背景与挑战
背景概述
该数据集由研究人员Realmbird等人于近期创建,聚焦于机械可解释性领域的核心问题——如何揭示大语言模型内部表征的语义内容。通过自然语言自编码器(NLA)技术,数据集采集了Qwen2.5-7B-Instruct模型在GSM8K数学推理测试集上、第20层残差流中‘####’标记处的激活向量,并将其转化为人类可读的自然语言描述。这一工作不仅为理解模型在推理终点处的决策机制提供了前所未有的视角,也开创性地将激活向量与语义描述直接对齐,从而推动了神经网络可解释性研究向更细粒度、更可解读的方向迈进。其发布为后续基于NLA的模型分析、安全对齐及知识编辑等研究奠定了坚实的数据基石。
当前挑战
当前数据集面临两大核心挑战。一方面,所解决的领域问题在于大语言模型内部激活向量的语义内容高度抽象且维度庞大(3584维),直接提取和解释极为困难,传统方法如探针分析或Logit透镜只能提供粗略映射,难以刻画模型在特定推理阶段所编码的精细语义信息。另一方面,构建过程中遭遇显著困难:使用的NLA生成器(kitft/nla-qwen2.5-7b-L20-av)在竞争数学数据上训练,导致GSM8K问题的描述中大量采用不匹配的语汇(如‘几何图形’、‘谜题’),进而严重削弱了描述准确性;同时,7B参数规模的生成器表达能力有限,在蕴含答案率上远低于理论预期(正确样本仅14.3%,而类似设定下Gemma模型可达~80%),表明构建更大规模、领域适配的生成器仍是提升数据质量的必由之路。
常用场景
经典使用场景
在机械可解释性研究领域,nla-thought-anchors-hash-step2数据集为探究大语言模型内部表征与输出之间的映射关系提供了独特视角。该数据集专门捕获了Qwen2.5-7B-Instruct模型在第20层残差流中对应'####' token处的激活向量——即模型完成链式推理后、即将输出最终答案前的关键神经状态。研究者通过自然语言自编码器将这一高维激活向量转化为可读的自然语言描述,从而将模型内部抽象的数值表征转化为人类可理解的语义内容。该数据集最经典的使用场景是验证并解析模型在推理末端时刻如何编码即将生成的答案信息,为理解大语言模型的推理机制提供了精细化的分析工具。
解决学术问题
该数据集直击大语言模型可解释性领域的核心难题:如何将模型内部的高维激活向量转化为可解释的语义表征,并量化其与模型输出之间的因果关系。通过比较正确与错误推理样例中激活向量的NLA描述差异,研究者能够定量评估模型在关键推理节点所编码的信息质量。数据集揭示了正确答案的激活描述中包含数字答案的比例为14.3%,远高于错误样例,这一发现为模型内部是否真正进行逻辑推理还是依赖表面模式匹配的学术争论提供了实证依据。此外,数据集还揭示了分布偏移和模型规模对NLA解码效果的影响,推动了跨模型、跨数据集的可解释性方法研究。
衍生相关工作
该数据集衍生了一系列具有深远影响的后续工作。基于同一NLA管线,研究者扩展了Step 1激活数据集和答案token变体数据集,形成了完整的nla-thought-anchors系列,为系统研究模型内部表征的时间演化提供了分阶段的数据支撑。NLA actor与critic模型的开放发布推动了自编码式可解释性方法在更大规模模型上的应用,激发了针对不同架构(如Gemma、LLaMA系列)的类似数据集构建工作。Ryan Greenblatt在LessWrong上发表的发现直接受益于该数据集的分析方法,其结论进一步引出了关于激活编码粒度与模型规模之间关系的新一轮学术探讨,促进了机械可解释性领域从定性描述向定量分析的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务