遇见数据集

Realmbird/nla-thought-anchors-hash_activations-step1

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为nla-thought-anchors-hash,是nla-thought-anchors项目的一部分,旨在复制和扩展Ryan Greenblatt关于自然语言自动编码器(NLA)的研究。它包含从Qwen2.5-7B-Instruct模型提取的GSM8K测试集激活向量和NLA语言化描述,具体在模型第20层(0索引)的####标记处提取,该标记是模型生成最终答案数字前的最后一个令牌。数据集分为两个文件:correct.parquet(模型答案与标准答案匹配的708个样本)和incorrect.parquet(模型答案不匹配的611个样本)。激活向量在模型完整生成思维链响应后,通过第二次前向传递在完整序列(提示+响应)上捕获,此时模型已完成所有推理并即将输出答案。NLA描述由演员模型kitft/nla-qwen2.5-7b-L20-av通过SGLang输入嵌入注入生成。数据集的列包括问题文本、标准答案、模型响应、正确性标志、激活向量(长度为3584的float32列表)、原始GSM8K测试集索引和NLA描述。研究发现,在正确样本中,NLA描述包含数值答案的比例为14.3%,低于原始研究中的80%,这归因于演员模型在分布外数据(训练于竞赛数学问题)和小模型容量上的限制。该数据集可用于分析NLA在提取模型内部表示方面的效果,并验证####令牌携带答案特定信息的机制主张。

This dataset, named nla-thought-anchors-hash, is part of the nla-thought-anchors project, which aims to replicate and extend Ryan Greenblatt's research on Natural Language Autoencoders (NLA). It contains activation vectors and NLA verbalized descriptions of the GSM8K test set extracted from the Qwen2.5-7B-Instruct model, specifically at the #### token in layer 20 (0-indexed) of the model, which is the final token immediately before the model generates the final numeric answer. The dataset is split into two files: correct.parquet (708 samples where the model's answer matches the reference standard answer) and incorrect.parquet (611 samples where the model's answer does not match the reference). The activation vectors are captured via a second forward pass over the full sequence (prompt + response) after the model has fully generated the chain-of-thought response, right before the model is about to output the final answer. NLA descriptions are generated via SGLang input embedding injection using the actor model kitft/nla-qwen2.5-7b-L20-av. The dataset columns include: question text, reference standard answer, model response, correctness flag, activation vector (a float32 list of length 3584), original GSM8K test set index, and NLA description. The study found that only 14.3% of correct samples contain numerical answers in their NLA descriptions, which is lower than the 80% reported in the original study. This discrepancy is attributed to limitations of the actor model, including out-of-distribution data (trained on competition math problems) and small model capacity. This dataset can be used to analyze the effectiveness of NLA in extracting internal model representations, and to validate the mechanistic claims that the #### token carries answer-specific information.

提供机构:
Realmbird
搜集汇总
数据集介绍
Realmbird/nla-thought-anchors-hash_activations-step1 数据集图片
构建方式
本数据集基于Qwen2.5-7B-Instruct模型在GSM8K测试集上进行激活值提取与自然语言自动编码器(NLA)描述生成。具体构建流程分为两步:首先,在模型完整生成思维链响应后,执行第二次前向传播,于第20层残差流中捕获####标记(模型输出最终答案前最后一词元)处的隐藏状态,得到维度为3584的激活向量;其次,借助专门训练的NLA角色模型kitft/nla-qwen2.5-7b-L20-av,通过SGLang输入嵌入注入技术,将激活向量转化为自然语言描述。数据集以parquet格式存储正确(708条)与错误(611条)两个子集。
特点
该数据集的核心特色在于聚焦特定推理阶段的神经表征。与提示词末尾词元几乎不包含答案信息不同,####标记处的激活值约有14%的概率直接编码了最终答案内容,这一比例相较于基线提升了14倍,验证了Ryan Greenblatt关于答案相关信息集中于特定位置的机械论解释。数据同时提供了NLA描述结果,但受限于角色模型在分布外GSM8K词句推理任务上的泛化局限,描述常映射至竞赛数学词汇,造成答案包含率远低于Gemma模型上的80%水平,这一发现为激活空间的任务特异性提供了直接证据。
使用方法
用户可通过HuggingFace Datasets库快速加载数据,使用load_dataset('Realmbird/nla-thought-anchors-hash')即可获取完整数据集。典型应用中,可以从correct或incorrect子集中提取激活向量数组(708×3584维)用于神经表征分析,或利用nla_description字段进行语言与神经编码的对比研究。数据集附带的正确性标记(is_correct)便于区分模型成功与失败案例,支持跨条件表征差异的因果探索。此外,关联数据集nla-thought-anchors-answer提供了答案词元处的对照数据,适合进行跨位置的比较分析。
背景与挑战
背景概述
该数据集由Realmbird团队于2024年创建,旨在探索机械可解释性领域中的自然语言自编码器(NLA)方法。核心研究问题围绕如何从大型语言模型(LLM)的内部激活空间中提取可解释的语义表征,特别是针对数学推理任务。数据集以Qwen2.5-7B-Instruct模型在第20层残差流中、于模型生成回答前的特定标记(`####`)处提取的激活向量为基础,结合GSM8K测试集的数学应用题,为分析模型在推理最终答案前的内部状态提供了独特视角。这一工作扩展了Ryan Greenblatt的早期发现,对理解LLM的推理机制与可解释性研究具有重要推动力。
当前挑战
数据集面临的核心挑战在于领域泛化与表征精度。首先,所解决的领域问题是:在数学推理任务中,如何通过NLA技术将模型的高维激活空间准确映射为人类可理解的自然语言描述,但现有方法在GSM8K数据集上的描述包含答案率仅14.3%,远低于Ryan Greenblatt在Gemma模型上报告的80%。这一差距主要源于两个方面:一是NLA演员模型是在竞赛数学(AMC/AIME)激活上训练的,导致对GSM8K的简单应用题激活空间存在分布外偏移,产生不相关的描述(如“几何图形”);二是7B规模的演员模型表达能力有限,无法充分捕捉激活中的丰富语义。构建过程中,还需解决激活提取位置的选择、确保在不同问题分布下的可迁移性等技术挑战。
常用场景
经典使用场景
在机械可解释性(Mechanistic Interpretability)这一前沿领域中,nla-thought-anchors-hash_activations-step1 数据集扮演着关键性的角色。它聚焦于大语言模型在数学推理过程中内部状态的语义解码,特别是针对 Qwen2.5-7B-Instruct 模型在 GSM8K 测试集上的推理行为。该数据集采集了模型在第20层残差流中、于‘####’标记处的隐藏状态激活向量,并借助自然语言自编码器(NLA)将其转化为人类可读的描述。经典用法是分析模型在即将输出最终答案前的内部表征,探究这些激活向量如何编码答案信息,从而验证‘思维锚点(thought-anchors)’这一概念——即特定标记处的隐藏状态承载着高度浓缩的语义内容。
实际应用
在工程实践中,该数据集为构建更可信、更安全的AI推理系统提供了工具。例如,通过分析‘####’位置激活向量的NLA描述,开发者可以监测模型在生成数学答案时的内部状态是否与预期一致,从而识别潜在的幻觉或错误推理路径。在模型调试场景中,若模型答错题目,数据集中错误样本的激活描述能帮助定位模型在哪个推理环节发生了语义漂移——例如,自编码器可能会描述为‘几何图形’而非实际的问题背景,这提示了分布外输入的检测需求。此外,该数据集还可用于训练更鲁棒的自然语言解码器,通过对比正确与错误样本的激活模式,改进模型在金融计算、科学计算等高风险场景下的输出可靠性。
衍生相关工作
该数据集衍生了一系列重要的后续工作。首先,它直接复现并拓展了Ryan Greenblatt关于自然语言自编码器的开创性研究,将实验从Gemma模型迁移至Qwen2.5系列,验证了‘思维锚点’现象的跨模型普适性。其次,数据集中‘####’标记与答案标记的激活对比,催生了对推理链中不同位置信息密度的系统性研究,相关成果如‘答案标记变体’数据集(Realmbird/nla-thought-anchors-answer)进一步探索了输出阶段的表征特性。此外,本研究所使用的NLA演员模型与评论家模型(kitft/nla-qwen2.5-7b-L20-av/ar)被作为基准工具,用于评估和改进更大规模语言模型(如70B参数级别)的可解释性。这些工作共同推动了机械可解释性从定性描述向定量分析的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务