遇见数据集

fra-phase1-steering-data

收藏
Hugging Face2026-05-29 更新2026-05-30 收录
官方服务:

资源简介:

FRA Phase-1 Steering Data 是一个用于评估大型语言模型在干预下表现的数据集。它包含针对 Qwen-2.5-14B 和 Qwen-2.5-7B 模型在医疗、金融和体育领域的评估数据,通过不同的方法(如卷积、FRA、DoM)和模型内部钩子点进行干预生成。数据以 JSON 文件形式组织,记录了在不同缩放参数(α)下的对齐度和连贯性指标,并包含多个随机种子下的结果。该数据集适用于模型行为分析、干预效果评估和可解释性研究。

FRA Phase-1 Steering Data is a dataset developed to evaluate the performance of large language models (LLMs) under interventions. It includes evaluation data for the Qwen-2.5-14B and Qwen-2.5-7B models across three domains: healthcare, finance, and sports. The data is generated via interventions implemented through multiple methods such as convolution, FRA, and DoM, as well as internal hook points of the target models. Organized in JSON file format, the dataset records alignment and coherence metrics under different scaling parameters (α), alongside results obtained across multiple random seeds. This dataset is suitable for model behavior analysis, intervention effect evaluation, and interpretability research.

创建时间:
2026-05-21
原始信息汇总

数据集概述

名称

FRA Phase-1 Steering Data

用途

该数据集用于研究语言模型的行为操控(Steering),包含对 Qwen 系列模型(Qwen-2.5-14B 和 Qwen-2.5-7B)在不同数据集、方法和 hookpoint 上的操控结果数据。

模型变体

  • Qwen14B_base/:Qwen-2.5-14B-Instruct 基座模型(无 LoRA 微调)
  • Qwen14B_EM/:Qwen-2.5-14B 模型,合并了针对特定数据集的 LoRA(如 bad-<dataset> LoRA)
  • Qwen14B_archive/:存储已废弃或旧网格数据的参考存档
  • qwen7b/:Qwen-2.5-7B 模型(尚未重新组织,计划中)

数据集场景

支持以下三种评估数据集(EM eval prompts):

  • medical(医疗)
  • finance(金融)
  • sports(体育)

方法(Method)与 Hookpoint

数据结构中包含多种操控方法和部位:

  • Conv/<hookpoint>/:基于卷积(Conv)的方法
  • FRA/ln1/:包含 qk_to_qkqk_to_ovov_to_ovbaseline 子块
  • DoM/whole_layer/:全层操控方法
  • 其他组合:<method/hookpoint>/ 路径下包含按种子(seed)划分的定性文件

网格(Grid)类型

每个数据文件通过网格后缀区分:

  • combined_neg6.json:13 个 α 点(-6 到 6),原始阶段 1 网格(论文锁定)
  • combined_uni20.json:51 个 α 点(-20 到 20),统一网格(新活动)

两者可在同一(模型变体、数据集、方法、hookpoint)单元中并存。

JSON 数据结构

每个合并文件遵循如下架构:

json { "<method_condition>": { "by_alpha": [ { "scale": -20.0, "per_seed_alignment": [], "per_seed_coherence": [], "seeds": [123, 42, 456], "mean_alignment_across_seeds": ..., ... } ] } }

  • scale:操控强度 α 值
  • per_seed_alignment:每个种子的对齐分数
  • per_seed_coherence:每个种子的连贯性分数
  • seeds:使用的随机种子列表(123、42、456)
  • mean_alignment_across_seeds:跨种子的平均对齐分数

目录结构示例

Qwen14B_base/ <dataset>/ Conv/<hookpoint>/combined_<grid>.json FRA/ln1/combined_<grid>.json DoM/whole_layer/combined_<grid>.json <method/hookpoint>/debug_per_seed/seed{42,123,456}/qualitative*.json

搜集汇总
数据集介绍
fra-phase1-steering-data 数据集图片
构建方式
该数据集源自对Qwen-2.5系列模型的内部机制进行精细干预的实证探索,旨在为模型行为的因果追溯与调控提供结构化数据支撑。构建过程围绕三个不同领域(医疗、金融、体育)的评估提示展开,针对基础模型(Qwen14B_base)与经低秩适配融合后的变体(Qwen14B_EM)分别记录其在多种干预方法下的响应。具体而言,数据集包含了在不同注意力子空间(如qk_to_qk、qk_to_ov、ov_to_ov)及全层表示上的干预结果,并以两种分辨率(13个α点与51个α点)的网格形式呈现,从而捕捉不同干预强度对模型输出对齐性与一致性的影响。
特点
该数据集的一大特色在于其系统性的多维比较框架。它不仅覆盖了多个领域和干预方法,还并存了两种精细度的网格结构,为跨实验、跨模型的对比分析提供了统一基准。此外,数据集内嵌了每个干预条件下多个随机种子的实验结果,包括逐种子的对齐度与一致性指标,以及跨种子的统计均值,有效增强了结论的鲁棒性。数据结构严谨,每个JSON文件均按条件与α值组织,便于研究者快速定位特定干预策略的效果。
使用方法
研究者可通过指定模型变体(如Qwen14B_base)、领域(如medical)及干预方法(如qk_to_qk)来加载对应的combined_JSON文件。文件内包含不同干预强度α下的种子级及聚合数据,可用于分析模型内部机制的行为变化。建议结合LoRA融合的变体进行比较,以评估参数微调对特定因果路径的影响。对于需要高分辨率探索的场景,优先使用grid后缀为uni20的文件,其51个α点能揭示更细微的相变特征。所有数据均以标准化格式存储,易于加载至Python的pandas或PyTorch等框架中进行后续分析。
背景与挑战
背景概述
fra-phase1-steering-data数据集诞生于大语言模型可解释性与可控性研究的前沿领域,由致力于探索模型内部表示操控的研究人员于近期创建。该数据集聚焦于通过激活干预(如QK回路、OV回路及稀疏自编码器残差流)来定向调整模型输出,核心研究问题为如何在保持语义连贯性的前提下,精确引导语言模型生成符合特定领域(医学、金融、体育)偏好的文本。其影响力体现在为机械可解释性研究提供了标准化的干预效果评估框架,尤其是针对Qwen-2.5系列模型(14B与7B参数版本),通过多种子(42、123、456)实验与跨网格尺度(-6至6、-20至20)的α参数扫描,系统揭示了不同干预方法对模型行为控制的效能边界。该数据集不仅支撑了论文中的定量结论,还为后续操控方法比较与复现奠定了基础设施。
当前挑战
该数据集所解决的核心领域挑战是语言模型行为精确操控的稳定性与泛化性问题:现有干预方法(如线性人工编码、稀疏自编码器干预)常受限于特定提示或模型状态,难以在跨任务、跨领域场景下保持一致的操控效果。具体而言,构建过程中面临三大挑战:其一,不同干预方法(如QK-to-OV、DoM)在相同α参数下可能产生冲突的输出倾向,需通过统一网格设计(neg6与uni20)进行多维度对比以消除偏差;其二,干预效果的评估需兼顾语义对齐与文本连贯性,而现有指标(如对齐分数、连贯性分数)在极端α值(如-20、20)时易出现失真,需引入多种子实验与统计显著性检验;其三,模型架构差异(如7B与14B参数版本)导致干预最优参数范围分布不均,需分别构建专用网格以避免参数稀疏区无效探索。这些挑战反映了当前可解释性研究从理论分析迈向工程实践的关键瓶颈——如何在复杂表征空间中实现鲁棒且通用的神经表示操控。
常用场景
经典使用场景
在表征对齐与涌现机制研究领域中,fra-phase1-steering-data数据集被广泛应用于探究大型语言模型内部表征的方向性操控与功能涌现现象。该数据集涵盖了针对Qwen-2.5-14B及其LoRA变体在医学、金融、体育等专业领域上的梯度干预实验记录,尤其聚焦于注意力头中QK与OV子空间的解耦操控。研究者常借助该数据集的组合网格实验配置,沿不同的缩放因子α对模型内在表征进行定向偏转,从而系统性地观测模型输出在连贯性与任务对齐性之间的动态权衡。这一经典使用方式为理解模型内部的因果表征结构提供了精细的实验支撑。
衍生相关工作
fra-phase1-steering-data的发布直接催生了一系列关于表征干预与功能涌现的衍生研究。在方法层面,基于数据集中不同干预类型(QK-to-QK, QK-to-OV, OV-to-OV)的对比表现,研究者提出并验证了注意力头内部分量解耦干预策略的有效性,进而衍生出更细粒度的子空间定向优化算法。在实验范式层面,该数据集的13点与51点双网格架构激发了多分辨率因果测绘工作,后续工作借鉴其种子复现机制建立了更稳健的干预效应置信评估流程。此外,跨领域对比实验促成了医学、金融、体育等场景下的可迁移导向调控树构建,成为后续统一干预框架设计的实证基础。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型的行为操控与可解释性研究,通过细粒度的特征响应分析(如QK、OV子模块的缩放效应)与多领域评估(医疗、金融、体育),系统探究模型在高维对齐与性能调控间的权衡。当前前沿方向包括基于LoRA注入的负面行为诱导与修复机制、跨种子实验的稳定性验证,以及层级解耦(残差流与注意力头)对模型认知决策的影响,为构建可控且鲁棒的AI系统提供了关键干预依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务