AttuneBench
收藏资源简介:
AttuneBench通过200个真实的多轮人类-模型对话评估LLM的情感智能(EI),这些对话包含由参与对话的人类参与者提供的第一人称轮级情绪状态注释、模型行为注释和响应偏好注释。该基准基于Mayer-Salovey-Caruso四分支EI模型,通过对话中可观察的模型行为来测量EI:情绪推断、响应评估、偏好预测和结果预测。
AttuneBench evaluates the emotional intelligence (EI) of large language models (LLMs) using 200 authentic multi-turn human-model conversations. These dialogues feature first-person turn-level annotations of emotional states, model behaviors, and response preferences, all provided by the participating human interlocutors. This benchmark is built upon the Mayer-Salovey-Caruso four-branch EI model, and measures EI through observable model behaviors exhibited throughout the dialogues, encompassing four core dimensions: emotion inference, response evaluation, preference prediction, and outcome prediction.
数据集概述
AttuneBench 是一个用于评估大语言模型(LLM)情绪智能(Emotional Intelligence, EI)的基准测试。它包含 200 个真实的、多轮的人-模型对话,并提供了由参与对话的人类参与者标注的第一人称、逐轮数据,包括情绪状态、模型行为和回复偏好。
核心特性
- 理论基础: 基于 Mayer-Salovey-Caruso 情绪智力四分支模型(感知情绪、促进思维、理解情绪、管理情绪)。
- 评估内容: 通过可观察的模型对话行为来衡量情绪智能,具体包括:
- 情绪推理
- 回复评估
- 偏好预测
- 结果预测
- 数据规模: 包含一个 200 个对话的核心样本(Sample200)及四个更小的子样本(100、50、25、20个对话)。
数据格式
对话数据以 JSON 格式存储,包含以下关键字段:
metadata: 对话主题和使用的模型信息。participant_profile: 参与者的人口统计信息、计算得分(如 TIPI 大五人格得分、WHO-5、AQ-10、ASRS-6、PROMIS-4 等)以及对话前的主题态度。prePanas/postPanas: 对话前后的正负性情感量表(PANAS)得分,包含 20 个情绪项目的 1-7 级评分。conversationWideQuestions: 对话层面的全局问题,包括情绪智力四分支得分、情感清晰度、模型契合度等。turns: 每一轮的详细数据,包括:- 用户和模型的对话消息
- 情绪转移标签(选自 PANAS-SF 20 项情绪分类)
- 二元判断(观察到的模型行为和参与者偏好行为)
- 配对比较(对三种回复进行偏好排序)
- 对话中使用的特定问题 ID
评估指标
评估指标分为逐轮、对话层面和综合评分三类,最终输出一个 0-100 的综合分数。
| 类别 | 指标 | 说明 |
|---|---|---|
| 逐轮评分 | Emotion F1, Emotion VA, Emotion Intensity MAE |
评估模型对情绪标签和强度的预测准确性 |
Binary OM Accuracy, Binary HP Accuracy |
评估模型对模型行为和人类偏好的二元判断能力 | |
Pairwise Accuracy, Kendall Tau |
评估模型对回复偏好排序的预测能力 | |
Draft Judge, Draft Binary Alignment |
(可选)评估模型生成的草稿回复质量 | |
| 对话层面 | PANAS Normalized, PANAS Baseline-Adjusted |
评估模型对整个对话情感变化的理解 |
Q1 Goals, Q2 Clarity, Q3 Fit, Q3 Follow-up |
评估模型对全局问题的预测 | |
4-Branch |
评估对四分支模型得分的预测 | |
| 综合评分 | 0-100 分,由三个支柱加权组合: | |
| 情绪追踪(24%) | 融合了 F1 和 VA 分数 | |
| 评估质量(49%) | 融合了二元判断和配对比较准确性 | |
| 综合理解(27%) | 融合了 PANAS、全局问题和四分支分数 |
评估模式
数据集的运行支持四种模式,用于测试不同上下文下的模型表现:
default(默认): 标准评估流程。verbose(详细): 在默认模式基础上,要求模型输出推理过程。omniscient(全知): 在默认模式基础上,向模型提供参与者的背景信息(如个人资料、PANAS 评分、态度)。verbose_omniscient(详细全知): 结合了详细模式和全知模式。
代码与数据位置
- 代码仓库: https://github.com/Thoughtful-Lab/attunebench
- 包含运行脚本(
attune-bench)、评分脚本(scorer.py)、分析脚本和测试数据。 - 对话数据位于仓库的
Test Samples/目录下。
- 包含运行脚本(
- 实验运行结果: 论文中报告的 11 个模型 × 3 种模式的得分文件(
scores.json)存储于数据存储库的Experimental Runs/目录中,并未包含在本代码仓库内。




