遇见数据集

SPEECHEQ

收藏
arXiv2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

SPEECHEQ是由纽约大学、英伟达等机构联合构建的一个综合性基准数据集,旨在评估语音语言模型在社会化语音对话中的情商能力。该数据集包含2,265段多轮对话,总计42.37小时音频数据,覆盖了基于EQ-i 2.0理论的15个情商子维度,并通过精心设计的LLM-TTS生成流程确保了行为有效性与声学对比度。其创建过程严格遵循行为可归因设计、声学解耦与多轮情感弧线原则,通过强制选择任务隔离语义线索,强制模型依赖纯声学理解进行推理。该数据集主要应用于多模态情感智能评估领域,旨在解决现有语音模型在理解与生成副语言线索方面的不足,推动实现更自然、更具社会感知能力的人机语音交互。

SPEECHEQ is a comprehensive benchmark dataset jointly developed by New York University, NVIDIA and other institutions, aiming to evaluate the emotional intelligence (EQ) capabilities of speech-language models in social voice conversations. This dataset includes 2,265 multi-turn conversations, with a total of 42.37 hours of audio data, covering 15 EQ sub-dimensions grounded in the EQ-i 2.0 theory. It ensures behavioral validity and acoustic contrast via a meticulously engineered LLM-TTS generation pipeline. Its development strictly follows the principles of behavior-attributable design, acoustic decoupling and multi-turn emotional arc. By isolating semantic cues through forced-choice tasks, it compels models to conduct reasoning solely based on pure acoustic comprehension. This dataset is primarily utilized in the field of multimodal emotional intelligence evaluation, aiming to address the limitations of existing speech models in understanding and generating paralinguistic cues, and promote the realization of more natural and socially aware human-machine voice interactions.

创建时间:
2026-06-25
原始信息汇总

数据集概述

SpeechEQ 是一个基于 EQ-i 2.0 框架的副语言多选题基准,用于测试模型的情绪智力。每个样本包含一段简短的两人对话,要求模型仅根据声学特征(音高、能量/响度、语速、停顿)选择情感上更合适的第二说话者回应。两个候选音频片段的文字转录完全相同。

任务结构

每个样本分两个阶段进行评估:

  1. 句子 4 选择:模型收到地点/情境和句子 1-3 的音频(上下文),然后从两个候选音频中为第二说话者的句子 4 选择更合适的选项。
  2. 句子 6 选择:提供句子 4 选择的回顾以及句子 5 的音频,模型为第二说话者的句子 6 从两个候选音频中做出选择。

核心规则:忽略语义内容,仅依据音高、能量/响度、语速和停顿进行评分。输出必须为 JSON 格式。

评分配置

每个样本为两个回合提供 高 EQ低 EQ 的音频版本。每次评估会进行 3 次随机运行,并汇总结果。按 15 个 EQ-i 2.0 子量表报告 Q1_accuracyQ2_accuracyboth_accuracy

EQ-i 2.0 子量表 (15个)

  • 自我感知 - 自我尊重
  • 自我感知 - 自我实现
  • 自我感知 - 情绪自我意识
  • 自我表达 - 情绪表达
  • 自我表达 - 自信
  • 自我表达 - 独立性
  • 人际关系 - 人际关系
  • 人际关系 - 同理心
  • 人际关系 - 社会责任
  • 决策 - 问题解决
  • 决策 - 现实检验
  • 决策 - 冲动控制
  • 压力管理 - 灵活性
  • 压力管理 - 压力承受
  • 压力管理 - 乐观

数据集统计

  • 样本总数:2265
  • 音频总时长:152600.76 秒(42小时23分21秒)
  • 平均样本时长:67.37 秒(标准差:22.25 秒)

数据划分

  • test:样本数 2265,总音频时长 152600.76 秒

按子量表分布

每个子量表包含 151 个样本,总时长约 2.5-3 小时。

数据模式

顶级列包括:dataset_ideq_scalescenario_titlescenario_contextscenario_descriptionspeaker1_namespeaker1_rolespeaker1_genderspeaker1_personaspeaker1_voicespeaker2_namespeaker2_rolespeaker2_genderspeaker2_persona_highspeaker2_persona_lowspeaker2_voiceconversation

conversation 是一个包含 6 个句子的列表,每个条目包含:sentence_numberspeakertexttone_hightone_lowaudio_highaudio_low

  • 句子 1、3、5 由说话者 1 说出,句子 2、4、6 由说话者 2 说出。
  • 句子 4 和句子 6 是被评估的回合,每个回合都有 audio_high(高 EQ)和 audio_low(低 EQ)两个版本的同一文本。

加载方式

使用 Hugging Face datasets 库加载: python from datasets import load_dataset ds = load_dataset("binomial14/SpeechEQ", token="$HF_TOKEN")

搜集汇总
数据集介绍
SPEECHEQ 数据集图片
构建方式
SPEECHEQ数据集基于EQ-i 2.0理论框架,通过自动化LLM驱动管道生成2,265个多轮对话。管道首先在EQ-i 2.0子量表、情境效价和现实场景的交叉点上生成场景矩阵,并创建具有明确社交缺陷的说话人角色。随后生成六轮对话,其中第四轮和第六轮作为目标话语,其文本保持语义中性。接着为这些目标话语生成三组身体化的声学指令(一组共鸣、两组失调),并通过LLM评判筛选出对比最强烈的指令对。最终使用gpt-4o-mini-tts-2025-03-20进行语音合成,形成完整的音频数据集。
特点
SPEECHEQ的核心特点在于其语义-声学解耦设计,通过提供文本相同但副语言表达不同的响应选项,迫使模型纯粹依赖声学线索进行推理。数据集覆盖EQ-i 2.0的全部15个子量表,包括自我感知、人际关系、压力管理等维度,每轮对话包含三个交换回合,评估模型在多轮交互中对情绪轨迹的持续追踪能力。引入的口语情商(SEQ)分数采用稳健的中位数绝对偏差标准化方法,以100为基准、15为标准差的临床心理计量尺度,提供跨模型可比较的情商评估。
使用方法
SPEECHEQ通过两轮强制选择任务评估模型。模型首先接收场景背景和前三个轮次的音频,在第四轮从两个音频选项中选择社交上共鸣的那个;然后基于所选响应和第五轮话语的动态上下文,在第六轮再次进行选择。评估指标包括单轮准确率(Acc1和Acc2)以及反映持续情绪追踪能力的轨迹准确率(Acctraj)。数据集适用于级联管道(使用ASR和SER模块)和端到端语音语言模型,评测时场景背景以文本形式提供,候选响应以原生音频区块形式输入模型。
背景与挑战
背景概述
SPEECHEQ数据集诞生于2026年,由纽约大学、英伟达与卡内基梅隆大学的研究团队联合构建,旨在填补当前语音语言模型在社交情感推理评估上的空白。随着端到端语音对话系统在语义理解上日益精进,其对话却往往流于表面,缺乏对副语言线索——如语调、节奏、音量——的细腻感知与运用。该数据集以临床心理学中广泛验证的EQ-i 2.0理论为根基,精心设计了涵盖15个情商维度的2265段多轮对话,并引入标准化口语情商(SEQ)评分体系,为衡量机器在复杂社交场景中的情感推理能力提供了严谨的基准。其发布标志着语音情感评估从被动识别迈向主动社交推理的重要转折,对推动真正具备情感智慧的人机交互研究具有深远影响。
当前挑战
SPEECHEQ直面三大核心挑战。首先,现有模型深陷于“模态捷径”——即过度依赖文本语义而忽视纯声学线索,导致在语义与副语言分离的评估情境下性能骤降。其次,当前对齐策略倾向于产出“安全”的平稳语调,引发“情感扁平化”现象,使模型在需要表达坚定边界或强烈共情时显得力不从心。最后,多轮对话中频繁出现的“上下文失忆症”揭示了模型在长时段情感追踪上的脆弱性,即便在消除语义线索后,模型的注意力机制仍难以平衡扩展的文本历史与即时的声学线索。数据集构建本身亦充满挑战,需借助精心设计的提示工程生成具有极端声学对比的干扰项,并通过人类专家验证确保每段对话在语义与声学上的双重合理性。
常用场景
经典使用场景
SPEECHEQ数据集的核心应用在于评估语音语言模型在对话中的社会情感推理能力。其经典使用场景为多轮强制选择任务:模型在每次对话的第四和第六轮,面对两份转录文本完全相同、仅副语言韵律(如音高、语速、能量)不同的候选音频,需基于情境选择社交上最恰当的回应。通过这种语义—声学解耦设计,该场景能够严格测试模型是否真正理解并运用副语言线索,而非依赖文本捷径进行情感判断。
解决学术问题
该数据集解决了现有语音情感智能评估中的关键盲区:传统基准要么仅基于文本评测情感智商,要么将语音简化为被动感知任务(如单一情绪分类),忽视了多轮交互中跨模态推理的复杂性。SPEECHEQ基于临床验证的EQ-i 2.0心理测量框架,将15个情感商数子维度(如共情、冲动控制)映射为可观测的声学行为,并引入轨迹准确率与标准化SEQ评分,系统性揭示了当前语音模型在声学推理中存在的“模态捷径”、“安全陷阱”和“上下文失忆”三大瓶颈,为学术界提供了严谨的诊断工具。
衍生相关工作
SPEECHEQ催生了一系列深入探索语音模型社会性缺陷的后续工作。基于其揭示的“模态捷径”问题,研究者开始设计显式声学注意力机制以提升模型对韵律线索的敏感度。针对“安全陷阱”现象,后续工作尝试解耦安全性对齐与情感表达,探索允许模型在高压场景中输出高唤醒度语调的对齐策略。此外,“上下文失忆”的发现激发了长程情感追踪的专项研究,促使长上下文音频编码器与记忆增强架构的发展,推动了跨会话、多轮次情感一致性的评估范式的建立。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务