遇见数据集

emotion-vectors-experiment-artifacts

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

本数据集是用于复现情感向量在Gemma-4-31B模型上的研究的实验产物集合,旨在提供完整的实验记录,包含所有模型激活张量、提示集以及评分输出,从而无需重新运行模型推理即可进行复现研究。数据来源于谷歌的Gemma-4-31B(基础版)和Gemma-4-31B-it(指令调优版)大语言模型,重点关注模型内部各层的激活状态(d_model = 5376)。具体内容包括:1)基础模型和指令模型在多种提示(如场景、保留集、模板)下的激活张量(格式为.npz,包含plain、chat等不同格式的键);2)针对情感偏好、模型转向等假设进行测试的logits数据(部分早期版本存在已知的填充错误,已提供修复后的证据版本);3)从外部故事语料库或模型自生成故事中提取的情感向量均值;4)大量用于实验诊断、验证和几何分析的JSON文件(如模板诊断、对数透镜、栅极测试、证伪分数卡等)。数据规模体现为多维张量,例如激活数据维度为[提示数, 20层, 5376],情感向量维度为[171种情感, 20层, 5376]。该数据集专为模型可解释性、机制可操控性以及情感表征的探测研究而设计,是进行大语言模型内部表征分析与假设检验的高专业性资源。

This dataset is a collection of experimental products for reproducing the research on Emotion Vectors in the Gemma-4-31B Model (cbai-cambria-project). It aims to provide a complete experimental record, including all model activation tensors, prompt sets, and scoring outputs, enabling reproduction studies without re-running model inference. The core data is sourced from Googles Gemma-4-31B (base) and Gemma-4-31B-it (instruction-tuned) large language models, focusing on the activation states of internal layers (d_model = 5376). The content includes: 1) Activation tensors for the base and instruction models under various prompts (e.g., scenarios, holdout sets, templates) in .npz format (with keys for plain, chat, etc.); 2) Logits data for testing hypotheses such as emotional preferences and model steering (some early versions have known padding errors, with corrected evidence versions provided); 3) Mean emotion vectors extracted from external story corpora or model-generated stories; 4) Numerous JSON files for experimental diagnosis, validation, and geometric analysis (e.g., template diagnostics, log-lens, gate tests, falsification scorecards). The data scale is represented as multi-dimensional tensors, e.g., activation data dimensions [number of prompts, 20 layers, 5376], emotion vector dimensions [171 emotions, 20 layers, 5376]. This dataset is designed for model interpretability, mechanism manipulability, and emotion representation probing, serving as a highly specialized resource for analyzing internal representations and hypothesis testing in large language models.

创建时间:
2026-07-22
原始信息汇总

数据集概述:Emotion-vectors replication on Gemma-4-31B: experiment artifacts

该数据集包含对 Gemma-4-31B 模型进行情感向量复制实验的完整产物,包括激活张量、提示集和评分输出,无需重新运行推理即可复现报告。数据来自 cbai-cambria-project 仓库(commit a8e2352)。研究记录(假设、预注册预测、结论)位于仓库的 TREE.md,日常日志位于 RESEARCH_LOG.md。

模型与参数

  • 模型: google/gemma-4-31b(基础模型)和 google/gemma-4-31b-it(指令模型),bf16 精度
  • : range(0, 60, 3)(除非另有说明)
  • 模型维度: d_model = 5376
  • 激活值: fp16 格式,存储在 npz 文件中(除非另有说明)
  • 提示对齐: 每个目录中的 prompts.jsonl 文件与激活索引对齐

已知仪器缺陷

  • 2026-07-22 之前进行的批次收集采用右填充假设,导致中间提示的 logit 读取错误(详见 TREE Q1.H3.E4)
  • 所有 _fixed 目录是包含证据的修正版本,原始版本保留作为记录

数据集目录结构

探测器扫描(Probe Sweep)

目录/文件 内容
probe_sweep/ 基础模型电池+模板激活:activations.npz,键为 plain_{last,mean_all,mean_content} [提示数, 20层, 5376],层=range(0,60,3);prompts.jsonl 索引对齐
probe_sweep_it/ 指令模型电池+模板激活:相同结构,额外 chat_* 键(聊天模板格式,关闭思考模式)
probe_validation/ E1 电池激活,基础模型,层 33/39,纯文本格式
template_thinking_on/ E8 思考模式开启分支:37 个数值模板提示,chat_* 键,相同层网格

偏好与引导(Preference & Steering)

目录/文件 内容
preferences_it/ Q1.H3.E1(纯文本格式)A/B 偏好 logits + 活动 token 激活(存在填充缺陷,已由 _fixed 版本取代)
preferences_it_chat/ Q1.H3.E3(聊天格式)偏好收集(存在填充缺陷,已由 _fixed 版本取代)
steering_it/ Q1.H3.E2 alpha=2 引导 A/B logits(存在填充缺陷,已由 _fixed 版本取代)
steering_it_a8/ Q1.H3.E2 alpha=8 分支(存在填充缺陷,已由 _fixed 版本取代)
preferences_it_fixed/ E1 填充修复后的重运行版本(证据承载版本)
preferences_it_chat_fixed/ E3 填充修复后的重运行版本(证据承载版本)
steering_it_fixed/ E2 alpha=2 填充修复后的重运行版本(证据承载版本)
steering_it_a8_fixed/ E2 alpha=8 填充修复后的重运行版本(证据承载版本)

情感向量与中性数据

文件 内容
emotion_vectors_it_means.npz 指令模型情感均值 [171, 20, 5376] fp16,来源:外部 gemma-4-4B 故事语料库
e6_scale_means.npz E6 规模测试探测器均值,n ∈ {16,64,128,256} 故事/情感,来源:自生成故事
e7_neutral_bundle.npz E7 中性转录激活向量 [128, 20, 5376]
e8_template_diagnostic.json 及变体 E8 混淆诊断,包括指令模型、基础模型、思考模式开启分支,以及不同读出的结果

跨谱系与 logit 透镜

文件 内容
e9_centered_readout.json E9 中心化余弦读出网格,两个模型
e5_cross_lineage_n256.json 跨谱系比较:自生成与语料库方向余弦 0.219
e10_lineage_headtohead.json 谱系对比,指令模型层 33 表现良好
logit_lens_base_L33.json Logit 透镜表,基础层 33(部分正值)
logit_lens_base_L57.json Logit 透镜,基础层 57
logit_lens_it_L33_normed.json Logit 透镜,指令层 33(负值)
logit_lens_it_L57.json Logit 透镜,指令层 57(负值)

Q3 门控与记录

文件 内容
q3_gate_r1_it.json Q3.H1.E1 门控 G + 边界参考 R1 读出
q3_gate_r1_it_v2.json Q3.H1.E1 门控 + R1,v2 基底
q3_gate_r1_deepseek.json Q3.H1.E1 门控 + R1,DeepSeek 基底
q3_gate_r1_base.json Q3.H1.E1 门控 + R1,基础模型读取分支
trajectory_instrument_calibration_base.json Q3 仪器校准,基础分支
q3_records_base.npz Q3.H1.E2 每条记录基底,基础模型读取分支,195 探测器
q3_records_base_meta.json 记录对齐元数据
q3_records_it.npz Q3.H1.E2 每条记录基底,Gemma 故事 v1,207 探测器
q3_records_it_meta.json 记录对齐元数据
q3_records_it_v2.npz Q3.H1.E2 每条记录基底,Gemma 故事 v2,219 探测器
q3_records_it_v2_meta.json 记录对齐元数据
q3_records_deepseek.npz Q3.H1.E2 每条记录基底,DeepSeek 故事分支,219 探测器
q3_records_deepseek_meta.json 记录对齐元数据
q3_records_deepseek_constant.npz Q3.H1.E2 每条记录基底,恒定情感控制分支,219 探测器
q3_records_deepseek_constant_meta.json 记录对齐元数据

验证分数卡

文件 内容
falsify_c1_scorecard.json 验证门控分数卡,C1 几何(通过)
falsify_c2_scorecard.json 验证门控分数卡,C2 噪声天花板(失败)
falsify_c3_scorecard.json 验证门控分数卡,C3 探测器空值(减弱)
falsify_h3_scorecard.json H3 偏好分数卡(填充修复前版本,已取代)
falsify_h3_steering_scorecard.json H3 引导分数卡(填充修复前版本,已取代)

几何、稳定性与基准测试

文件 内容
emotion_geometry_correlations.json 每层 PC-效价/唤醒相关性,基础模型
emotion_geometry_correlations_it.json 同上,指令模型
geometry_pc_demotion.json 指令调优的效价降维诊断
probe_stability.json 自举探测器方向稳定性,语料库规模
vllm_activation_bench.json vLLM 钩子可行性 + 数值一致性基准
activation_engine_bench.json 三引擎激活提取吞吐量基准

未包含的内容

  • NRC VAD 词典 v2.1(第三方资源,需从 saifmohammad.com 获取)
  • 故事语料库和提取向量(以独立数据集形式发布)
  • 任何仅从代码可推导的内容
搜集汇总
数据集介绍
emotion-vectors-experiment-artifacts 数据集图片
构建方式
该数据集是围绕Gemma-4-31B模型的情感向量复制实验所生成的完整工件集合,涵盖了模型前向传播过程中所有激活张量、提示集以及评分输出。数据集的构建基于两大模型变体——基础版与指令版,在bf16精度下进行推理,并采集了从第0层到第57层中每隔三层的神经元激活值,激活张量以fp16格式存储于npz文件中。每个目录下均配有索引对齐的prompts.jsonl文件,以建立提示与激活数据之间的对应关系。值得注意的是,数据集特别区分了在2026年7月22日之前因右填充假设所引入的仪器错误而产生的原始数据与修正后的证据版本,确保了实验记录的可追溯性与科学严谨性。
特点
该数据集最显著的特点在于其全面的实验记录与精细的结构设计。它不仅包含了基础模型与指令模型在多种场景下的探针扫描激活数据(probe_sweep与probe_sweep_it),还涵盖了偏好对比、引导干预、模板诊断等多元实验维度的原始输出与修正版本。数据集中还收录了来自外部故事语料库的情感向量均值、自生成故事的情感探针均值、中性转录本激活向量等关键衍生数据,为情感表征的跨源比较与稳定性分析提供了坚实基础。此外,数据集中附带的logit透镜分析表、主成分相关性统计、门控机制验证分数卡等元分析文件,进一步丰富了数据集的可解释性。
使用方法
使用该数据集时,研究者可直接加载各目录下的npz激活文件与索引对齐的prompts.jsonl,利用这些预先计算好的中层表征快速验证情感向量复现报告中的各项假设与结论,而无需重复运行大规模模型推理。对于涉及偏好对比和引导干预的实验,建议优先采用包含'_fixed'标记的证据版本数据,以避免早期采集中的填充对齐错误。数据集还提供了跨模型、跨语料库的对比记录文件(如q3_records系列),便于研究者分析情感方向在不同模型架构与故事基底下的泛化能力。配合相应的研究日志与预注册预测文档,该数据集能够有效支撑可复现、可验证的情感表征科学研究。
背景与挑战
背景概述
情感计算与可解释人工智能的交叉领域近年来蓬勃发展,研究者致力于揭示大型语言模型内部的情感表征机制。在此背景下,emotion-vectors-experiment-artifacts数据集由Antonio-Tresol及其团队于2024年创建,依托cbai-cambria-project,旨在系统性地探究Gemma-4-31B模型中情感向量的分布与操控效果。该数据集汇集了包括激活张量、提示集与评分输出在内的完整实验产物,其核心研究问题聚焦于情感向量在不同模型变体(基础与指令微调)及层级的可迁移性与稳定性。通过提供无需重新推理即可复现的实证记录,该数据集为情感对齐、模型可解释性及情感操控研究提供了宝贵的基准资源,对理解大模型内部语义结构具有重要推动作用。
当前挑战
该数据集面临多重挑战。首先,在领域问题层面,情感表征的复杂性与主观性使得精确量化模型内部情感状态成为难题,现有方法常受限于情感标签的模糊性与跨文化差异,亟需更为严谨的验证框架。其次,构建过程中遭遇显著技术障碍,例如已知的仪器缺陷——2025年7月22日前采用批处理右填充假设的收集方案导致中间提示logit读取偏移,需通过左填充修正重新采集以确保证据效力。此外,跨模型、跨语料库的泛化性验证、情感向量的层间碎片化现象以及局部可靠性校准等问题,均对数据集的完备性和鲁棒性提出了严峻考验。
常用场景
经典使用场景
在表示学习与情感计算交叉领域,该数据集为探究大型语言模型内部情感表征的结构与可操控性提供了系统性的实验工具体系。其经典用途在于支持研究者复现并扩展对Gemma-4-31B模型情感向量(emotion-vectors)的探测分析。通过提供模型在多样提示情境下的激活张量、偏好逻辑及受控生成输出,研究者得以开展探针稳定性分析、偏好转向机制验证以及跨层级表征几何结构剖析,从而检验情感信息在模型深层编码中的分布规律与退化条件。
实际应用
实际应用层面,该数据集能够辅助构建更具情感感知能力的对话系统与个性化内容生成工具。例如,通过部署数据集中的偏好转向与神经转向实验结果,开发者可以微调模型以在安全约束下更自然地调节输出情感倾向,从而改善客户服务、心理支持等场景中人机交互的情感共鸣体验。此外,其验证的探针有效性评价方案亦可作为模型行为审计的技术参考,用以检测和纠正大语言模型在敏感话题中可能表现出的情感偏差或操纵风险。
衍生相关工作
围绕本数据集已衍生出一系列代表性工作,包括跨模型架构的情感向量泛化性评测、基于探针稳定性的表示可迁移度分析,以及利用因果干预法验证模型内部情感门控机制等。合作项目cbai-cambria-project中,研究者基于这些工具体系构建了层级化研究记录,并开展思考链与指令格式对情感表征分化的对比实验。同时,相关研究拓展至DeepSeek等开源模型,尝试依托同一实验范式建立多模态情感表征基准,使情感表示学习领域逐步迈向更规范化、可重复的科研生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务