SPEECHEQ
收藏资源简介:
SPEECHEQ是由纽约大学、英伟达等机构联合构建的一个综合性基准数据集,旨在评估语音语言模型在社会化语音对话中的情商能力。该数据集包含2,265段多轮对话,总计42.37小时音频数据,覆盖了基于EQ-i 2.0理论的15个情商子维度,并通过精心设计的LLM-TTS生成流程确保了行为有效性与声学对比度。其创建过程严格遵循行为可归因设计、声学解耦与多轮情感弧线原则,通过强制选择任务隔离语义线索,强制模型依赖纯声学理解进行推理。该数据集主要应用于多模态情感智能评估领域,旨在解决现有语音模型在理解与生成副语言线索方面的不足,推动实现更自然、更具社会感知能力的人机语音交互。
SPEECHEQ is a comprehensive benchmark dataset jointly developed by New York University, NVIDIA and other institutions, aiming to evaluate the emotional intelligence (EQ) capabilities of speech-language models in social voice conversations. This dataset includes 2,265 multi-turn conversations, with a total of 42.37 hours of audio data, covering 15 EQ sub-dimensions grounded in the EQ-i 2.0 theory. It ensures behavioral validity and acoustic contrast via a meticulously engineered LLM-TTS generation pipeline. Its development strictly follows the principles of behavior-attributable design, acoustic decoupling and multi-turn emotional arc. By isolating semantic cues through forced-choice tasks, it compels models to conduct reasoning solely based on pure acoustic comprehension. This dataset is primarily utilized in the field of multimodal emotional intelligence evaluation, aiming to address the limitations of existing speech models in understanding and generating paralinguistic cues, and promote the realization of more natural and socially aware human-machine voice interactions.
数据集概述
SpeechEQ 是一个基于 EQ-i 2.0 框架的副语言多选题基准,用于测试模型的情绪智力。每个样本包含一段简短的两人对话,要求模型仅根据声学特征(音高、能量/响度、语速、停顿)选择情感上更合适的第二说话者回应。两个候选音频片段的文字转录完全相同。
任务结构
每个样本分两个阶段进行评估:
- 句子 4 选择:模型收到地点/情境和句子 1-3 的音频(上下文),然后从两个候选音频中为第二说话者的句子 4 选择更合适的选项。
- 句子 6 选择:提供句子 4 选择的回顾以及句子 5 的音频,模型为第二说话者的句子 6 从两个候选音频中做出选择。
核心规则:忽略语义内容,仅依据音高、能量/响度、语速和停顿进行评分。输出必须为 JSON 格式。
评分配置
每个样本为两个回合提供 高 EQ 和 低 EQ 的音频版本。每次评估会进行 3 次随机运行,并汇总结果。按 15 个 EQ-i 2.0 子量表报告 Q1_accuracy、Q2_accuracy 和 both_accuracy。
EQ-i 2.0 子量表 (15个)
- 自我感知 - 自我尊重
- 自我感知 - 自我实现
- 自我感知 - 情绪自我意识
- 自我表达 - 情绪表达
- 自我表达 - 自信
- 自我表达 - 独立性
- 人际关系 - 人际关系
- 人际关系 - 同理心
- 人际关系 - 社会责任
- 决策 - 问题解决
- 决策 - 现实检验
- 决策 - 冲动控制
- 压力管理 - 灵活性
- 压力管理 - 压力承受
- 压力管理 - 乐观
数据集统计
- 样本总数:2265
- 音频总时长:152600.76 秒(42小时23分21秒)
- 平均样本时长:67.37 秒(标准差:22.25 秒)
数据划分
test:样本数 2265,总音频时长 152600.76 秒
按子量表分布
每个子量表包含 151 个样本,总时长约 2.5-3 小时。
数据模式
顶级列包括:dataset_id、eq_scale、scenario_title、scenario_context、scenario_description、speaker1_name、speaker1_role、speaker1_gender、speaker1_persona、speaker1_voice、speaker2_name、speaker2_role、speaker2_gender、speaker2_persona_high、speaker2_persona_low、speaker2_voice、conversation。
conversation 是一个包含 6 个句子的列表,每个条目包含:sentence_number、speaker、text、tone_high、tone_low、audio_high、audio_low。
- 句子 1、3、5 由说话者 1 说出,句子 2、4、6 由说话者 2 说出。
- 句子 4 和句子 6 是被评估的回合,每个回合都有
audio_high(高 EQ)和audio_low(低 EQ)两个版本的同一文本。
加载方式
使用 Hugging Face datasets 库加载:
python
from datasets import load_dataset
ds = load_dataset("binomial14/SpeechEQ", token="$HF_TOKEN")




