遇见数据集

synthetic emotion-story datasets

收藏
arXiv2026-06-25 更新2026-06-29 收录
官方服务:

资源简介:

该数据集是由苏黎世联邦理工学院研究团队构建的合成情绪故事数据集,旨在探究开源大语言模型中的情绪向量表征。数据集包含1539个故事样本,覆盖171种不同情绪类别,每个情绪对应9个由APERTUS-8B和GEMMA-4-E4B模型生成的短篇叙事文本,并额外包含40个中性故事作为对照基准。数据生成过程采用标准化提示模板,要求模型创作角色体验目标情绪但不直接提及情绪名称的叙事内容,形成跨模型对比的实验语料。该数据集主要应用于计算语言学和人工智能可解释性研究领域,专门用于分析语言模型内部情绪表征的几何结构、跨层演化规律及其与人类心理学维度(效价-唤醒度)的对应关系。

This dataset is a synthetic emotional story dataset constructed by a research team from ETH Zurich, aimed at exploring emotional vector representations in open-source large language models (LLMs). The dataset contains 1539 story samples covering 171 distinct emotion categories. For each emotion category, there are 9 short narrative texts generated by the APERTUS-8B and GEMMA-4-E4B models, with an additional 40 neutral stories serving as control benchmarks. The data generation process adopts standardized prompt templates, which require the models to create narrative content where characters experience the target emotion without directly mentioning the name of the emotion, thereby forming experimental corpora for cross-model comparison. This dataset is mainly applied in the fields of computational linguistics and AI interpretability research, and is specifically used to analyze the geometric structure of emotional representations within language models, the cross-layer evolution rules, and their correspondence with human psychological dimensions (valence-arousal).

创建时间:
2026-06-25
原始信息汇总

数据集概述

本数据集是关于大型语言模型中情感向量研究的复现项目,主要针对两个开源模型(Apertus 8B 和 Gemma 4 E4B)的残差流进行情感向量提取与分析。

核心内容

  • 研究目标:复现 Anthropic 的情感向量工作,生成情感标注故事,提取模型隐藏状态下的情感向量,并分析其几何结构。
  • 模型与数据规模
    • Apertus 8B:包含 513 个提示、1,539 个故事。
    • Gemma 4 E4B:包含 513 个提示、1,539 个故事。
    • 每个数据集结构为:171 种情感 × 3 个主题 × 3 个故事。

数据来源与格式

加载方式

使用 datasets 库即可加载:

python from datasets import load_dataset

ds = load_dataset("snae/emotion_stories_Apertus_8B_Instruct") row = ds["train"][0] print(row["emotion"], "—", row["topic"]) for story in row["stories"]: # 3 stories per row print(story[:80], "...")

数据属性

  • 每条记录包含:情感标签(emotion)、主题(topic)、三个故事(stories)。
  • 使用场景:可直接跳过本地故事生成步骤,直接从 Hugging Face Hub 加载数据集,用于后续的情感向量提取与分析。

相关工具与流程

该数据集是完整流水线中的一环,整个流程包括:

  1. 生成情感故事(可跳过,直接使用发布的数据集)
  2. 提取情感向量(支持从 Hugging Face 加载故事)
  3. 分析情感向量(PCA、UMAP、CKA 分析)
  4. 跨模型几何比较

引用与归属

该项目是对 Anthropic 情感向量研究的复现,原始论文:

Sofroniew, Kauvar, Saunders, Chen & et all. (2026). Emotion Concepts and their Function in a Large Language Model.
https://transformer-circuits.pub/2026/emotions/index.html

搜集汇总
数据集介绍
synthetic emotion-story datasets 数据集图片
构建方式
该数据集以合成方式构建,旨在捕捉大型语言模型内部的情感表征。研究团队遵循Sofroniew等人的方法,分别使用APERTUS-8B和GEMMA-4-E4B两个开源模型,针对171种情感概念生成短篇故事。对于每种情感,模型被提示撰写9个故事,其中角色体验该情感但不得直接命名,转而通过角色的行动、身体感受、对话及情境背景间接传达。由此每个模型生成1,539个故事(171种情感×9个故事),并附加40个中性故事作为对照基底。两个生成语料库被视作独立变量,以分离模型固有几何结构与语料依赖的提取伪影。
特点
数据集的核心特点在于其双模型、双语料的实验设计,能够系统性地检验情感向量的跨模型泛化性与提取语料的敏感性。在APERTUS-8B中,效价表征呈渐近涌现模式,在深层网络突现高峰(r=0.76);而GEMMA-4-E4B则在早期层即达到峰值(r=0.83)后迅速衰减,展现出截然不同的深度演化轨迹。唤醒度的编码表现显著依赖于故事来源,使用Gemma生成的语料时,两模型的PC2-唤醒度相关性可达0.45,而使用Apertus生成的语料时则不超过0.21。这种跨层几何结构的差异揭示了相似效价峰值可掩藏截然不同的计算路径。
使用方法
研究人员通过在指定层缓存残差流激活,计算每种情感相对于中性故事子空间的对比向量,以提取特定层的情感表征矩阵。对每一层的情感对比矩阵进行主成分分析,将前两个主成分与NRC效价-唤醒度-支配度词典的人类评分进行皮尔逊相关分析,以量化情感几何结构的效价与唤醒度轴。运用线性中心核对齐计算层间表征相似性,追踪情感几何结构在网络深度中的演化。通过比较相邻层间效价方向向量的余弦相似度,评估情绪轴在模型不同深度的稳定性。
背景与挑战
背景概述
该数据集由苏黎世联邦理工学院的Sinie van der Ben、Raphaël Baur、Yannick Metz与Mennatallah El-Assady于2026年共同创建,发表于ICML 2026的可解释性机制研讨会。研究团队针对大型语言模型内部情感表征的可迁移性问题,构建了synthetic emotion-story datasets。核心研究问题在于验证Claude模型中发现的“情感向量”是否普遍存在于不同架构的开源模型中,并探究情感几何结构在模型深度上的演化规律。这一工作为理解语言模型的情感内部表征提供了跨架构的实证基础。
当前挑战
该数据集面临的核心挑战包括:其一,情感向量在跨模型架构间的可迁移性,即APERTUS-8B与GEMMA-4-E4B在效价编码的涌现轨迹上呈现显著差异——前者在深层逐步建立效价表示,而后者在早期编码后于中层发生坍塌,揭示情感表征机制的非一致性。其二,构建过程中的语料依赖性挑战尤为突出,模型生成的语料库在唤醒度编码上呈现强敏感性,采用Gemma生成的故事相较于Apertus生成的故事,其PC2-唤醒度相关性可提升超过一倍,表明语料选择直接影响情感向量的提取质量。
常用场景
经典使用场景
在情感计算与可解释人工智能的交叉领域中,synthetic emotion-story datasets作为精心构建的合成情感故事数据集,主要用于探索大型语言模型内部情感表示的几何结构与动态演化规律。经典的用法是,研究者通过向不同架构的开源语言模型输入171种情绪对应的短篇故事,提取各层残差流中的对比向量,随后运用主成分分析将情感空间映射至效价与唤醒度两个核心维度,并基于中心核对齐与余弦相似度等度量工具,揭示模型内部情感表征的涌现时机、跨层迁移模式以及语料库效应。这一范式为复现和检验前沿情感向量理论的跨架构普适性提供了关键的实证素材。
实际应用
synthetic emotion-story datasets的实际应用涵盖了从大规模语言模型的安全性审计到情感智能接口的改进。在安全对齐领域,通过监测模型内部情感向量的异常偏移,可实现对奖励黑客、勒索等不良行为的早期预警,从而提升部署过程中的可信赖度。在人机交互层面,数据集支持对模型跨层情感表征的方向稳定性进行分析,为基于对比激活添加技术的定向情感干预提供层选依据,使开发者能够更精确地调控模型在客服、教育或心理健康辅助等场景中的情感反应。此外,该数据集还可用于评估不同语言模型在叙事理解中对隐性情感线索的编码能力,为多模态与跨语种情感建模提供基准测试工具。
衍生相关工作
该数据集衍生了一系列聚焦于情感线性表征与跨架构比较的经典研究。在方法论上,后续工作借鉴了其对比向量提取与PCA-效价对齐的流程,将该范式拓展至Llama、Qwen等模型家族中,成功识别出具有圆周模型一致性的效价—唤醒度子空间,并通过沿着这些情感主轴的操控实现了对拒绝应答与谄媚行为的干预。另有研究采用稀疏自编码器对模型内部的情感特征进行解耦,揭示出不同层级可能通过截然不同的特征组合来编码相同的情感概念。该数据集还推动了跨层表征几何相似性与情感方向稳定性的深入探讨,为理解语言模型中抽象概念的计算路径多样化提供了坚实的实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务