遇见数据集

SpeechSense

收藏
arXiv2026-08-18 更新2026-08-20 收录
官方服务:

资源简介:

SpeechSense是由香港中文大学计算机科学与工程学系构建的专注于副语言特征的细粒度语音情感分析数据集。该数据集包含669条高保真合成语音音频剪辑,覆盖自信、紧张、热情、冷漠、激动、不耐烦、讽刺和中性八种人际立场标签,通过严格的语义-韵律解耦文本设计、角色扮演TTS合成及双重阶段人工验证流程构建。数据集的创建旨在克服现有语音情感分析中依赖文本管道丢失声学线索以及标签粒度不匹配的局限,为研究细粒度人际立场检测提供基准,强调韵律特征在捕捉微妙说话者态度中的核心作用。

SpeechSense is a fine-grained paralinguistic speech emotion analysis dataset constructed by the Department of Computer Science and Engineering, The Chinese University of Hong Kong. It contains 669 high-fidelity synthetic speech audio clips covering eight interpersonal stance labels: confident, nervous, enthusiastic, indifferent, excited, impatient, sarcastic, and neutral. The dataset is built through strict semantic-prosody decoupled text design, role-playing TTS synthesis, and a two-stage manual verification process. This dataset is developed to address the limitations of existing speech emotion analysis research, which often loses acoustic cues when relying on text-centric pipelines and faces the problem of mismatched label granularity. It aims to provide a benchmark for fine-grained interpersonal stance detection and highlights the critical role of prosodic features in capturing subtle speaker attitudes.

创建时间:
2026-08-18
原始信息汇总

SpeechSense 数据集详情

基本信息

  • 数据集名称:SpeechSense
  • 发布状态:已被 ACM Multimedia 2026 Dataset Track 接收(2026年8月)
  • 数据集定位:面向细粒度语音情感分析的副语言焦点数据集(Paralinguistic-Focused Dataset)

核心特点

与大多数仅标注“快乐”“悲伤”等基本情绪(basic emotions)的语音情感数据集不同,SpeechSense 专注于人际立场(interpersonal stances)——即说话者向听者传达的态度,这些态度主要由韵律(prosody)而非词汇选择承载。

所有载体句(carrier sentences)均设计为语义中性,使情感完全体现在“说话方式”上。基准测试结果显示:

  • 具备声学访问能力的模型:macro F1 达到 53-57%
  • 纯文本模型:macro F1 仅为 5-22%,证实该任务无法仅通过转录文本解决

标签体系

数据集包含 8个标签,划分为四组对比对:

分组 标签
内部确定性(Internal Certainty) 自信(Confident)· 紧张(Nervous)
高能量效价(High-Energy Valence) 热情(Passionate)· 不耐烦(Impatient)
社会连接(Social Connection) 温暖(Warm)· 冷漠(Apathetic)
韵律偏差(Prosodic Deviation) 讽刺(Sarcastic)· 中性(Neutral)

数据集构成

数据集分为两个部分,均托管于 Hugging Face:

分区 音频片段数 文本来源 链接
测试集 669 Qwen3-Max https://huggingface.co/datasets/BruceW13/SpeechSense
训练集 1,522 Gemini 3 Pro https://huggingface.co/datasets/BruceW13/SpeechSense-Training

仓库内容

仓库包含以下文件与目录:

  • results/:结果文件
    • per_class_f1_audio.csv:五个音频模型的各类别 F1 分数
    • per_class_f1_text.csv:四个纯文本模型的各类别 F1 分数
    • prediction_dist_audio.csv:音频模型对测试集各类的预测分布
    • prediction_dist_text.csv:纯文本模型的预测分布
    • confusion_matrices/:全部九种配置的原始计数和热力图
  • synthesis_directives/:传递给 TTS 引擎的角色扮演风格提示
  • training_scripts/:各模型族的微调代码
  • HYPERPARAMETERS.md:全部九个模型的训练配置
搜集汇总
数据集介绍
SpeechSense 数据集图片
构建方式
SpeechSense数据集的构建遵循一套严谨的三阶段流程,旨在最大化态度差异并最小化合成伪影。首先,借助Qwen3-Max生成语义中性的载体文本,严格剔除情感词汇,确保文本内容不泄露任何态度倾向,并控制时长在3至8秒内。随后,选取Lovo.ai作为合成引擎,基于斯坦尼斯拉夫斯基方法设计角色扮演提示词,将八类人际态度映射至具体表演指令,生成韵律丰富的音频样本。最后,通过Prolific平台招募母语为英语的标注者,采用多数投票与参考对齐相结合的双阶段筛选策略,对960条样本进行人工验证,最终保留669条高质量音频,构成均衡的测试集。此外,另使用Gemini 3 Pro生成1522条训练样本,以弱监督方式保障数据规模。
使用方法
SpeechSense数据集适用于多类语音情感分析模型的训练与评测。使用时,可将音频直接输入至多模态大语言模型(如Qwen2.5-Omni)或专用语音编码器(如Whisper、HuBERT),附加线性分类头进行监督微调,实现八类态度的精准识别。亦可与文本基线模型(如Qwen2.5-Instruct)对比,验证韵律信息对细粒度情感检测的不可或缺性。数据集的训练集(1522条)与测试集(669条)划分明确,测试集经人工验证,可作为金标准评估;训练集则用于模型参数优化。全部资源以CC BY 4.0协议开源,包含音频、标签及合成指令,便于复现实验结果并推动后续研究。
背景与挑战
背景概述
SpeechSense数据集由香港中文大学的Shicheng Ma、Wenqian Cui和Irwin King于2026年提出,旨在解决细粒度语音情感分析中副语言信息被忽视的问题。该数据集聚焦于人际立场(如自信、紧张、热情等)而非基本情绪,通过定义8类标签体系,结合高保真语音合成与严格人工验证构建,提供了969条音频样本。其核心研究问题在于验证声学线索在检测微妙说话者态度中的必要性,实验表明多模态模型在声学访问下显著优于纯文本基线,凸显了副语言特征在情感理解中的关键作用。SpeechSense作为首个专门针对副语言立场的细粒度数据集,填补了现有基准在标签粒度和声学信息利用上的空白,推动了语音情感分析向更细腻的社交动态理解迈进的进程。
当前挑战
SpeechSense面临的挑战主要源于语音情感分析中副语言信息的复杂性与数据稀缺性。领域层面,传统级联式方法依赖ASR转文本进行情感分析,不可避免地丢失韵律、语调等关键声学特征,导致对含糊语句(如讽刺)的态度理解失准;同时,现有数据集(如IEMOCAP、RAVDESS)仅标注基本情绪,未能捕捉如自信、冷漠等细微人际关系态度,标签粒度的错配限制了模型的社会敏感性。构建层面,高质量副语言语音数据难以获取,需借助TTS合成,但合成语音的真实性和声学保真度需通过人工验证严格把控,且需确保文本内容语义中性以隔离韵律影响,这要求合成策略(如角色扮演法)与多阶段过滤流程的精密配合。此外,标注者间一致性(Fleiss' Kappa仅0.44)和合成与真实语音间的域差异,仍是数据集泛化性的关键瓶颈。
常用场景
经典使用场景
SpeechSense数据集在语音情感分析领域开辟了全新的研究方向,其核心应用场景聚焦于细粒度人际立场的识别与理解。该数据集通过精心设计的8类标签体系——涵盖自信、紧张、热情、冷漠等微妙态度,突破了传统基本情绪分类的局限。研究者利用该数据集可系统评估多模态大语言模型、纯文本模型及专用语音编码器在捕捉副语言线索方面的能力差异,尤其适用于探究韵律特征(如音高、节奏、语调)对情感判别的关键作用。典型实验范式包括跨模态对比分析、零样本与监督学习性能评估,以及混淆矩阵驱动的错误模式挖掘,为深入理解语音情感认知机制提供了标准化测试平台。
解决学术问题
SpeechSense数据集精准回应了语音情感分析领域长期存在的两大核心挑战:一是传统级联式文本中心流程(ASR+文本分析)不可逆地丢失韵律、音调等关键副语言信息,导致对含混语音中态度性意义的识别失效;二是现有基准(如IEMOCAP、RAVDESS)的标签粒度粗放,无法覆盖人际交往中细腻的立场表达。该数据集通过语义-韵律解耦的文本设计与严格的语料构建流程,首次实现韵律线索与词汇内容的高度隔离,为验证'如何说'优于'说什么'这一理论假设提供了实证基础。其意义在于确立了声学通道在细粒度情感检测中的主导地位,推动研究范式从文本中心向声学感知转型,并填补了人际立场离散标注体系的空白。
实际应用
SpeechSense数据集在现实世界具有广泛的应用潜力,尤其在需要精准解读说话者微妙态度的专业场景中彰显价值。在人才招聘领域,该数据集可用于训练AI系统区分求职者'自信'与'紧张'的语音表达,辅助面试官做出更客观的评估决策;在客户服务行业,通过实时识别通话中的'不耐烦'或'热情'等情绪状态,系统能动态调整沟通策略以提升服务满意度;在心理健康辅助诊断中,'冷漠'或'焦虑'的声学特征检测为临床评估提供客观量化指标。此外,该数据集还可赋能智能语音助手、自动对话系统等,使其具备理解用户潜在情感倾向的能力,从而提供更具人性化的交互体验。
数据集最近研究
最新研究方向
SpeechSense数据集的最新研究方向聚焦于利用副语言线索(如韵律、语调、节奏等)进行细粒度语音情感分析,突破了传统基于文本的情感分析范式。该数据集定义了八类人际态度标签(如自信、紧张、热情、冷漠等),并通过高质量语音合成与人工验证构建,旨在克服现有基准中标签粒度不足和声学信息丢失的问题。当前研究重点包括多模态大语言模型(如Qwen2.5-Omni)与语音编码器(如Whisper、HuBERT)在细粒度情感识别上的性能对比,验证了声学特征对捕捉微妙说话人态度的关键作用。SpeechSense的提出填补了副语言情感分析领域的空白,推动人机交互向更自然、更具社会感知的方向发展,具有重要的理论与应用价值。
相关研究论文
  • 1
    SpeechSense: A Paralinguistic-Focused Dataset for Fine-Grained Speech Sentiment Analysis香港中文大学·计算机科学与工程学系 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务