遇见数据集

ASLP-lab/HumDial-EIBench

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

HumDial-EIBench是一个用于评估音频语言模型情感理解能力的人类录制多轮对话情感智能基准。该基准旨在诊断模型是否真正理解语音中的情感,而非依赖文本转录的捷径。数据集基于ICASSP 2026 HumDial挑战赛的真实人类录音对话构建,包含中文和英文子集,总计1,077个样本。核心目标是通过四个任务评估模型在记忆、推理、生成和跨模态鲁棒性方面的情感智能:任务1为情感轨迹检测(多轮跟踪情感变化),任务2为隐式因果推理(从上下文线索推断情感触发因素),任务3为共情响应生成(评估文本共情、声学共情和音频质量),任务4为声学-语义冲突(测试文本情感与声学情感矛盾时的鲁棒性)。数据设计强调真实人类多轮音频、客观对抗性多选题任务,以及声学-语义冲突任务,以解决现有基准中合成语音、单轮设置和主观评分等问题。

HumDial-EIBench is a human-recorded multi-turn emotional intelligence benchmark for audio language models, designed to evaluate whether ALMs truly understand emotion in speech rather than relying on text transcription shortcuts. Built from authentic human-recorded dialogues from the ICASSP 2026 HumDial Challenge, it includes both Chinese and English subsets with a total of 1,077 samples. The core goal is to diagnose emotional intelligence in ALMs across memory, reasoning, generation, and cross-modal robustness through four tasks: Task 1 (Emotional Trajectory Detection) tracks emotion changes across dialogue turns, Task 2 (Implicit Causal Reasoning) infers latent emotional triggers from scattered context clues, Task 3 (Empathetic Response Generation) evaluates responses in textual empathy, vocal empathy, and audio quality, and Task 4 (Acoustic-Semantic Conflict) tests robustness when text sentiment contradicts vocal affect. The benchmark addresses gaps in existing ALM evaluations by combining real human multi-turn audio, objective adversarial MCQ tasks, and a dedicated acoustic-semantic conflict task.

提供机构:
ASLP-lab
搜集汇总
数据集介绍
ASLP-lab/HumDial-EIBench 数据集图片
构建方式
HumDial-EIBench基于ICASSP 2026 HumDial挑战赛中的真实人类录音对话构建,覆盖中文与英文两个子集,总计包含1077个样本。数据集采用三阶段流水线方式构建:首先从真实多轮对话中提取原始音频与文本,随后设计四项客观任务以实现对情感智能的细粒度诊断,最后通过对抗性多选题(MCQ)与开放式生成任务相结合的方式,确保评估的严谨性与全面性。其中,情感轨迹检测与隐含因果推理任务聚焦于多轮上下文中的情感演化与因果推断,而声学-语义冲突任务则专门用于检测模型在文本与语音情感矛盾时的鲁棒性。
特点
该数据集的核心特点在于其对抗性多选题设计与多维度诊断能力。所有任务均基于真实人类录音而非合成语音,避免了TTS数据带来的声学伪装效应。情感轨迹检测任务要求模型在3至5轮对话中追踪情感变化,而非分类孤立语句;隐含因果推理任务则考验模型从分散线索中推断潜在情感触发因素的能力。此外,数据集通过声学-语义冲突任务揭示了当前音频语言模型普遍存在的文本主导偏差,并支持对文本共情与声学共情的分离评估,为模型改进提供了明确方向。
使用方法
用户可通过HuggingFace平台直接下载数据集,并参照官方指南进行评估。对于任务3(共情响应生成),需使用提供的评估脚本eval/eval_task3.py,该脚本自动识别目标评估轮次(第二个非中性情感轮次),并基于历史轮次构建上下文。输入需为jsonl格式,包含对话ID、轮次情感标签、文本及生成音频路径。运行命令需指定模型名称、输入文件与输出路径,且依赖GPU环境与vLLM库。评估结果涵盖文本共情(LLM评分)、声学共情与音频自然度(人工评分)三个维度,最终输出逐样本与汇总分数。
背景与挑战
背景概述
HumDial-EIBench是西北工业大学音频语音与语言处理实验室(ASLP Lab)联合多位研究者于2026年发布的多模态情感智能评估基准。该数据集源自ICASSP 2026 HumDial挑战赛,包含中文和英文双语的真实人声多轮对话样本,共1077条。核心研究问题在于诊断音频语言模型是否真正理解语音中的情感,而非依赖文本转录的捷径。该基准通过客观对抗性多选题任务、声学-语义冲突检测以及文本共情与声学共情的分离诊断,系统评估模型在情感记忆、推理、生成和跨模态鲁棒性等方面的能力。HumDial-EIBench的提出填补了现有基准依赖合成语音、仅支持单轮设定、以及评价主观性过强的空白,对推动音频语言模型的情感智能研究具有重要影响力。
当前挑战
该数据集所解决的领域挑战核心在于现有音频语言模型普遍缺乏对复杂多轮对话中情感动态演变的真实理解能力,尤其在跨轮情感轨迹追踪与隐式因果推理方面表现不佳。具体挑战包括:1)多轮情感跟踪难题,要求模型捕捉3至5轮对话中情感的连续变化而非孤立识别;2)隐式因果推理挑战,模型需从散布的上下文线索中推断诱发情感的潜在因素;3)声学-语义冲突挑战,当文本情绪与声调情感矛盾时,模型暴露出显著的文本主导偏见,难以依赖声学线索做出正确判断;4)文本共情与声学共情之间的解耦挑战,表明单纯生成共情文本而忽略语音韵律的和谐性仍无法实现真正的情感理解。此外,数据构建过程中仍需克服真实人声多轮对话的高标注成本、跨语言情感标注一致性以及客观多选题设计中的去主观化等挑战。
常用场景
经典使用场景
HumDial-EIBench最为经典的使用场景在于评估音频语言模型(ALM)对语音中情感的深层理解能力,而非简单地依赖文本转录的表面线索。该基准通过四个精心设计的任务——情感轨迹检测、隐式因果推理、共情响应生成以及声学-语义冲突测试,全面诊断模型在多轮对话中理解、推理和表达情感的能力。每个任务均基于真实人类录音构建,包含中英文双语子集,确保评估的生态效度与跨语言适用性。研究者通常使用该基准来检验ALM在情感记忆、跨轮推理、共情生成以及跨模态鲁棒性等方面的综合表现,从而判断其是否具备真正的情感智能。
衍生相关工作
自HumDial-EIBench发布以来,其开创性的评估范式已催生了一系列衍生研究工作。一方面,研究者基于该基准设计了针对情感轨迹预测的专用模型架构,探索在音频特征空间中融合时序注意力机制以提升多轮情感跟踪的准确性;另一方面,针对其发现的文本-声学解耦现象,学术界提出了跨模态对抗训练策略,旨在缓解ALM在声学-语义冲突情境下的文本偏见。此外,该基准的任务设计理念也被借鉴至其他音频理解任务,如基于情感因果关系推理的对话状态跟踪模型开发,以及将共情生成评估指标纳入多模态对话系统的优化目标。相关成果陆续发表在语音、自然语言处理与情感计算交叉领域的顶级会议中,进一步推动了情感AI的评估标准化进程。
数据集最近研究
最新研究方向
当前,音频语言模型(ALM)的情感智能评估正从依赖合成语音和单轮文本的浅层范式,向基于真实人类多轮对话、融合声学与语义冲突的深度诊断方向演进。HumDial-EIBench作为ICASSP 2026 HumDial挑战赛的产物,基于1,077个中英双语音频样本,创新性地设计了情感轨迹检测、隐式因果推理、共情响应生成及声学-语义冲突四大任务,以对抗性多选题(MCQ)替代主观开放式评分,客观剥离模型在文本共情与声学共情上的表现差异。该基准揭示了一个关键发现:当前主流ALMs普遍存在文本主导偏差,在多轮情感追踪与隐式推理任务中表现欠佳,且声学共情与文本共情能力严重解耦。这一工作不仅为情感计算领域提供了首个兼具真实录音、多轮语境与跨模态鲁棒性评估的标准化工具,更凸显了突破“以文代声”捷径、实现真正多模态情感理解的迫切需求,对推动下一代情感感知人机交互系统的可信评估具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务