遇见数据集

AttuneBench

收藏
github2026-05-29 更新2026-05-30 收录
官方服务:

资源简介:

AttuneBench通过200个真实的多轮人类-模型对话评估LLM的情感智能(EI),这些对话包含由参与对话的人类参与者提供的第一人称轮级情绪状态注释、模型行为注释和响应偏好注释。该基准基于Mayer-Salovey-Caruso四分支EI模型,通过对话中可观察的模型行为来测量EI:情绪推断、响应评估、偏好预测和结果预测。

AttuneBench evaluates the emotional intelligence (EI) of large language models (LLMs) using 200 authentic multi-turn human-model conversations. These dialogues feature first-person turn-level annotations of emotional states, model behaviors, and response preferences, all provided by the participating human interlocutors. This benchmark is built upon the Mayer-Salovey-Caruso four-branch EI model, and measures EI through observable model behaviors exhibited throughout the dialogues, encompassing four core dimensions: emotion inference, response evaluation, preference prediction, and outcome prediction.

创建时间:
2026-05-09
原始信息汇总

数据集概述

AttuneBench 是一个用于评估大语言模型(LLM)情绪智能(Emotional Intelligence, EI)的基准测试。它包含 200 个真实的、多轮的人-模型对话,并提供了由参与对话的人类参与者标注的第一人称、逐轮数据,包括情绪状态、模型行为和回复偏好。

核心特性

  • 理论基础: 基于 Mayer-Salovey-Caruso 情绪智力四分支模型(感知情绪、促进思维、理解情绪、管理情绪)。
  • 评估内容: 通过可观察的模型对话行为来衡量情绪智能,具体包括:
    • 情绪推理
    • 回复评估
    • 偏好预测
    • 结果预测
  • 数据规模: 包含一个 200 个对话的核心样本(Sample200)及四个更小的子样本(100、50、25、20个对话)。

数据格式

对话数据以 JSON 格式存储,包含以下关键字段:

  • metadata: 对话主题和使用的模型信息。
  • participant_profile: 参与者的人口统计信息、计算得分(如 TIPI 大五人格得分、WHO-5、AQ-10、ASRS-6、PROMIS-4 等)以及对话前的主题态度。
  • prePanas / postPanas: 对话前后的正负性情感量表(PANAS)得分,包含 20 个情绪项目的 1-7 级评分。
  • conversationWideQuestions: 对话层面的全局问题,包括情绪智力四分支得分、情感清晰度、模型契合度等。
  • turns: 每一轮的详细数据,包括:
    • 用户和模型的对话消息
    • 情绪转移标签(选自 PANAS-SF 20 项情绪分类)
    • 二元判断(观察到的模型行为和参与者偏好行为)
    • 配对比较(对三种回复进行偏好排序)
    • 对话中使用的特定问题 ID

评估指标

评估指标分为逐轮、对话层面和综合评分三类,最终输出一个 0-100 的综合分数。

类别 指标 说明
逐轮评分 Emotion F1, Emotion VA, Emotion Intensity MAE 评估模型对情绪标签和强度的预测准确性
Binary OM Accuracy, Binary HP Accuracy 评估模型对模型行为和人类偏好的二元判断能力
Pairwise Accuracy, Kendall Tau 评估模型对回复偏好排序的预测能力
Draft Judge, Draft Binary Alignment (可选)评估模型生成的草稿回复质量
对话层面 PANAS Normalized, PANAS Baseline-Adjusted 评估模型对整个对话情感变化的理解
Q1 Goals, Q2 Clarity, Q3 Fit, Q3 Follow-up 评估模型对全局问题的预测
4-Branch 评估对四分支模型得分的预测
综合评分 0-100 分,由三个支柱加权组合:
情绪追踪(24%) 融合了 F1 和 VA 分数
评估质量(49%) 融合了二元判断和配对比较准确性
综合理解(27%) 融合了 PANAS、全局问题和四分支分数

评估模式

数据集的运行支持四种模式,用于测试不同上下文下的模型表现:

  • default(默认): 标准评估流程。
  • verbose(详细): 在默认模式基础上,要求模型输出推理过程。
  • omniscient(全知): 在默认模式基础上,向模型提供参与者的背景信息(如个人资料、PANAS 评分、态度)。
  • verbose_omniscient(详细全知): 结合了详细模式和全知模式。

代码与数据位置

  • 代码仓库: https://github.com/Thoughtful-Lab/attunebench
    • 包含运行脚本(attune-bench)、评分脚本(scorer.py)、分析脚本和测试数据。
    • 对话数据位于仓库的 Test Samples/ 目录下。
  • 实验运行结果: 论文中报告的 11 个模型 × 3 种模式的得分文件(scores.json)存储于数据存储库的 Experimental Runs/ 目录中,并未包含在本代码仓库内。
搜集汇总
数据集介绍
AttuneBench 数据集图片
构建方式
AttuneBench 基准数据集基于 Mayer-Salovey-Caruso 情绪智力四分支模型精心构建,专注于评估大型语言模型在真实多轮人机对话中的情绪智能。数据集源自 200 场完整的人类与模型交互会话,由每位参与对话的人类主体提供第一人称视角、逐轮次标注的情绪状态、模型行为及响应偏好。每轮对话均包含丰富的结构化注释,涵盖情绪转换标签、二元判断、成对比较及替代响应等维度,构成一个兼具生态效度与理论深度的评估框架。
特点
该数据集的核心特色在于其多模态、多层次的标注体系。每轮对话不仅标注了基于 PANAS-SF 量表的 20 维情绪标签及其强度,还包含 36 个二元判断问题(同时覆盖模型实际行为与人类偏好),以及 4 个成对比较问题下的 12 组响应排序。此外,数据集完整记录了参与者的个人画像(包括人口统计学信息、大五人格评分及心理健康筛查得分)、对话前后的情绪状态变化,以及对话整体的四分支评分,为细粒度的情绪智能评估提供了前所未有的丰富维度。
使用方法
使用者可通过命令行工具 `attune-bench` 对任意模型进行标准化评估。首先使用 `attune-bench run` 命令在四种模式(默认、详细、全知、全知详细)下运行模型,生成逐轮次的情绪推断、响应评估与偏好预测结果;随后通过 `attune-bench score` 命令依据真实标注计算涵盖情绪追踪、评估质量与整体理解三大支柱的复合评分。数据集提供四个不同规模的子样本,支持不同成本预算下的灵活评估,同时支持与 HuggingFace lm-evaluation-harness 的无缝集成,便于进行标准化的大规模模型比较分析。
背景与挑战
背景概述
AttuneBench诞生于人工智能情感智能评估领域的前沿探索之中,由国际研究团队于近期打造,旨在系统性地衡量大语言模型在复杂人际对话中的情绪感知与回应能力。该基准测试植根于Mayer-Salovey-Caruso四分支情绪智力理论框架,通过200场真实的多轮人机对话,邀请人类参与者逐轮标注自身情绪状态、模型行为偏好及对回应的主观评价,从而将情绪智力这一抽象构念转化为可量化的观测指标。AttuneBench不仅填补了现有评测体系对情绪动态演化与交互质量深度关注的空白,更为情感计算领域提供了首个融合第一人称视角与精细行为标注的标准化评估工具,对推动AI系统从单纯的语言生成迈向共情式交互具有里程碑式的引领价值。
当前挑战
AttuneBench面临的核心挑战在于如何精准捕捉并量化对话中瞬息万变的情感动态。情感标签的模糊性与主观性使得真值标注充满内在歧义,即使同一句话也可能被不同的观察者赋予迥异的情绪解读,这给情绪分类的评估标准带来了严峻考验。在评测构建层面,跨对话的多重模式切换、多轮次设计中的成本控制与调用容错成为实际瓶颈;同时,避免模型因上下文锚定而产生预测偏倚,要求每一轮的情绪推理与偏好判断均保持独立,这对评测架构的鲁棒性与可复现性提出了极高要求。此外,如何平衡细粒度标注的丰富性与标注者疲劳带来的质量衰减,亦是此类评测数据集研发中难以绕开的持久性难题。
常用场景
经典使用场景
AttuneBench在情感计算与人机交互交叉领域中,被广泛用于评估大型语言模型在动态、多轮对话中的情绪智力表现。该基准基于Mayer-Salovey-Caruso四分支模型,通过200段真实的人机交互对话及其逐轮的参与人行为与偏好标注,系统考察模型在情绪感知、响应评估、偏好预测及结果推断四个维度的能力。研究者利用其标准化的默认、详细、全知以及详细全知四种评估模式,对模型在自然对话流中的情绪追踪精度与社交感知能力进行量化分析与比较。
实际应用
在实际应用中,AttuneBench为构建具备高度情感敏感性的对话代理提供了核心测评工具。心理健康咨询、教育辅导及客户服务等对情绪交互质量有严苛要求的领域,亟需确认AI系统能否准确识别用户情绪状态并作出得体回应。该数据集能够帮助开发者系统验证模型在情绪支持场景中的表现,优化对话策略与响应的情感适应性,从而提升用户体验满意度与交互的自然流畅度。
衍生相关工作
AttuneBench的发布催生了一系列重要的后续研究,包括基于其标注体系训练的情绪感知模型、针对特定人群(如神经多样性用户)的情绪推理优化工作,以及利用其多维度评分指标(如情感F1、配对准确性)改进对话系统情感对齐的研究。此外,该数据集还被用于开发情绪推理链生成任务,探索模型在提供情绪判断理由时的可解释性,推动了情感AI领域从简单分类向复杂推理的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务