遇见数据集

Realmbird/gsm8k-qwen2.5-7b-L20-activations

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是从Qwen/Qwen2.5-7B-Instruct模型第20层(共28层)提取的残差流激活数据,针对GSM8K测试集的1319个示例,聚焦于输入提示的最后一个令牌。数据集根据模型回答是否正确分为两个文件:correct.parquet(708行,模型答案与标准答案匹配的示例)和incorrect.parquet(611行,模型答案不匹配的示例)。每行数据包含以下列:问题文本(GSM8K问题)、标准答案(包含真实思维链和答案)、模型响应(Qwen2.5-7B-Instruct的贪婪生成结果)、正确性标志(布尔值,表示模型答案是否与标准答案一致)、激活向量(长度为3584的float32列表,表示第20层残差流在最后一个提示令牌处的激活状态)和示例索引(在GSM8K测试集中的索引)。提取细节包括:模型为Qwen/Qwen2.5-7B-Instruct,层为20(0索引,即第20个transformer块后的残差流输出),位置为输入提示的最后一个令牌(生成开始前),数据类型为float32,模型维度为3584,解码方式为贪婪解码。数据集旨在与自然语言自编码器检查点配对使用,用于解码模型在GSM8K数学推理问题上正确与错误推理时第20层残差流的表示。

This dataset consists of residual stream activation data extracted from layer 20 (out of 28 total layers) of the Qwen/Qwen2.5-7B-Instruct model, covering 1319 examples from the GSM8K test set, with a focus on the last token of the input prompt. The dataset is split into two files based on whether the model's answer is correct: correct.parquet (708 rows, containing examples where the model's answer matches the ground-truth one) and incorrect.parquet (611 rows, containing examples where the model's answer does not match the ground-truth one). Each row contains the following columns: question text (GSM8K problem), ground-truth answer (contains the full Chain-of-Thought (CoT) and final answer), model response (greedy generation output from Qwen/Qwen2.5-7B-Instruct), correctness flag (a boolean value indicating whether the model's answer matches the ground-truth answer), activation vector (a float32 list of length 3584 representing the activation state of the 20th-layer residual stream at the last prompt token), and example index (the index within the GSM8K test set). Extraction details are as follows: the model is Qwen/Qwen2.5-7B-Instruct, the layer is 20 (0-indexed, i.e., the residual stream output after the 20th transformer block), the position is the last token of the input prompt (right before the start of generation), the data type is float32, the model dimension is 3584, and the decoding strategy is greedy decoding. This dataset is designed to be used in conjunction with natural language autoencoder checkpoints for decoding the residual stream representations of the model during correct and incorrect mathematical reasoning on GSM8K math problems.

提供机构:
Realmbird
搜集汇总
数据集介绍
Realmbird/gsm8k-qwen2.5-7b-L20-activations 数据集图片
构建方式
该数据集从Qwen2.5-7B-Instruct模型的第20层(共28层)残差流中提取激活值,聚焦于输入提示的最后一个token位置。数据源自GSM8K测试集,共包含1319个样本,并根据模型回答的正确性划分为两个文件:correct.parquet(708个正确回答样本)与incorrect.parquet(611个错误回答样本)。提取过程中采用贪心解码策略(do_sample=False,max_new_tokens=512),确保生成结果的可复现性。每个样本不仅记录了问题文本、标准答案和模型输出,还保存了维度为3584的浮点型激活向量及其对应的样本索引。
使用方法
该数据集预设有配套的NLA检查点使用方案。用户可加载预训练的动作器(verbalizer)'kitft/nla-qwen2.5-7b-L20-av'对激活向量进行语义解码,以文字形式解释模型在该层所表征的推理特征;同时可借助批评器(reconstructor)'kitft/nla-qwen2.5-7b-L20-ar'验证重构保真度。通过对比正确与错误样本的激活模式,研究者能够定位导致数学推理失误的潜在神经机制,为模型可解释性与安全对齐研究提供实证基础。
背景与挑战
背景概述
在机械可解释性(Mechanistic Interpretability)领域,理解大型语言模型内部表征与推理行为之间的关系是当前研究的核心问题之一。GSM8K是一个广泛使用的数学推理基准测试,旨在评估模型在多步算术问题上的表现。该数据集由研究人员于2024年创建,基于Qwen2.5-7B-Instruct模型在GSM8K测试集上的运行时激活值,聚焦于第20层(共28层)残差流在输入提示最后一个token处的活动。数据集将正确与错误回答的激活向量分别存储,便于研究者探究模型内部状态如何区分成功与失败的推理过程。其发布不仅为机械可解释性研究提供了结构化的激活数据,也推动了自然语言自编码器(NLA)等方法的发展,对理解语言模型内部工作机制具有重要影响。
当前挑战
该数据集所解决的领域问题主要包括:一是数学推理任务中模型内部表征的可解释性挑战,即如何从高维残差流激活中定位与正确推理相关的神经模式;二是模型错误行为的归因分析,即揭示导致模型在GS8K等推理任务上失败的具体内部状态差异。在构建过程中,面临的主要挑战包括:精确提取指定层(第20层)与指定位置(最后一个提示token)的激活向量,并确保其与模型生成行为的时间对齐;需从1319个测试样本中正确划分正确与错误回答,避免因模型贪婪解码的不确定性导致分类误差;此外,还需处理高维(3584维)浮点激活数据的存储与索引,以支持后续机械可解释性分析的高效访问。
常用场景
经典使用场景
在可解释性研究领域,GSM8K-Qwen2.5-7B-L20-Activations数据集为探索大型语言模型内部神经表征提供了珍贵的研究素材。研究者通过提取模型第20层残差流在输入提示最后一个token处的激活值,能够深入剖析模型在数学推理任务中的内部计算机制。该数据集特别支持将正确与错误推理结果进行对比分析,利用自然语言自动编码器(NLA)框架下的角色网络(Verbalizer)与评论家网络(Reconstructor),科研人员可以解码模型内部隐藏状态所蕴含的语义信息,揭示了模型在正确与错误推理路径上表征模式的差异性。
解决学术问题
该数据集有效打破了大型语言模型内部工作机制被视为'黑箱'的研究瓶颈。通过提供标准化的激活值数据集,学者们得以系统性地探究模型在数学推理任务中哪些神经单元负责关键计算步骤的编码,以及正确与错误推理轨迹在表征空间中的分界线是如何形成的。这一研究范式推动了机械可解释性(Mechanistic Interpretability)领域从定性分析向定量化、可验证的方向发展,为理解Transformer架构中深层表征的语义组成原理、构建可解释的推理路径图谱提供了坚实的数据基础。
实际应用
在实际应用层面,该数据集为提升大模型推理可靠性的技术方案提供了验证基准。基于激活值分析结果,研究人员可以设计更精确的推理错误检测机制,或在模型推理过程中实时干预特定神经单元的激活模式以纠正错误倾向。此外,该数据集还支撑了知识蒸馏与模型压缩领域的创新工作,通过识别对正确推理起决定性作用的神经通路,为构建更高效的小参数模型保留了必要的计算结构,推动了从学术研究到工业部署的技术转化。
数据集最近研究
最新研究方向
当前,基于大规模语言模型的数学推理能力成为可解释性研究的前沿焦点,而gsm8k-qwen2.5-7b-L20-activations数据集正是为深入探索这一领域而构建。该数据集聚焦于Qwen2.5-7B-Instruct模型在GSM8K数学推理任务中第20层残差流的激活模式,并按照模型回答正确与否进行了精细划分。其核心价值在于配合自然语言自编码器(NLA)框架,通过激活值分析揭示模型内部状态与推理成败之间的深层关联。这一研究方向紧密呼应了近期关于大模型机制可解释性(mechanistic interpretability)的热潮,尤其在利用可解释的潜在表征定位模型错误推理根源方面具有开创意义。通过解码不同推理结果对应的神经激活模式,研究者有望更清晰地理解模型如何在复杂数学问题中进行逻辑运算,从而为改进模型可靠性和鲁棒性提供理论依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务