遇见数据集

susameddin/Sympatheia-18k

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

Sympatheia-18k是一个情感感知的语音对话数据集,专为共情语音合成研究设计。它包含18,000个查询-响应对,覆盖12种情感类别(包括愤怒、焦虑、满足、厌恶、兴奋、沮丧、快乐、中性、放松、悲伤、惊讶和疲劳)。每个对都配有合成音频和文本转录。数据集分为两个子集:Emotional子集包含情感查询和情感匹配的响应,而Neutral子集包含中性查询,每个查询与12种情感目标响应配对。数据集还包括音频文件(WAV格式)、元数据文件(JSONL格式,包含查询和响应文本对以及情感标签)和预编码的音频令牌(用于Sympatheia模型)。情感类别映射到效价-唤醒值,以支持情感感知的语音合成任务。

Sympatheia-18k is an emotion-aware spoken dialogue dataset for empathetic speech synthesis research. It contains 18,000 query–response pairs across 12 emotion categories (Angry, Anxious, Content, Disgusted, Excited, Frustrated, Happy, Neutral, Relaxed, Sad, Surprised, Tired), each accompanied by synthesized audio and text transcripts. The dataset is structured into two subsets: the Emotional subset includes emotional queries with emotionally-matched responses, and the Neutral subset consists of neutral queries each paired with 12 emotion-targeted responses. It provides audio files (in WAV format), metadata files (in JSONL format, containing text pairs and emotion labels), and pre-encoded audio tokens (for use with the Sympatheia model). Emotion categories are mapped to valence–arousal values to facilitate emotion-aware speech synthesis tasks.

提供机构:
susameddin
搜集汇总
数据集介绍
构建方式
Sympatheia-18k数据集专为情感感知的共情语音对话系统研究而构建,涵盖了12种离散情感类别,总计包含18,000组查询-响应配对。数据集分为情感子集和中性子集:情感子集中,查询与响应均携带相匹配的情感标签,包含8,400条训练数据和3,600条评估数据;中性子集则包含350条训练和150条评估的中性查询,每条查询分别与12种不同情感的目标响应配对,共生成4,200条训练和1,800条评估配对。所有配对均附带合成音频(WAV格式)及文本转录,音频文件以情感标签和索引命名。此外,数据集中提供了预编码的音频令牌文件,供Sympatheia模型直接使用。
特点
该数据集的核心特点在于其双重视角的情感标注机制。情感子集中的'query_style'与'user_emotion'一致,明确反映了说话人的情感表达;中性子集则巧妙模拟了真实对话场景:查询虽以中性语调合成,但'user_emotion'标注了用户潜在的真实情感(如沮丧),从而要求模型从平静的言语中感知并生成具有共情色彩的回应。这种设计旨在训练模型超越表层语调,理解深层次的情感语境。所有情感类别均映射到程序化定义的效价-唤醒度数值,为模型提供了情感强度的量化依据。
使用方法
Sympatheia-18k适用于情感语音合成及共情对话系统的训练与评估。研究者可使用JSONL格式的文本配对文件直接训练文本到语音或语音到文本模型;亦可利用预编码的音频令牌文件,结合情感标签与效价-唤醒度数值,在Sympatheia框架中进行端到端的情感感知对话生成。数据集通过HuggingFace的configs参数划分为'emotional'与'neutral'两个配置,便捷加载指定子集。训练时建议关注中性子集的特殊结构与情感迁移能力,评估时则可分别计算各情感类别的合成质量与共情一致性指标。
背景与挑战
背景概述
Sympatheia-18k数据集由苏萨姆·埃丁(Susa Meddin)及其团队于近期创建,旨在推动情感感知的共情语音对话系统研究。该数据集聚焦于语音合成与多模态交互中的情感建模核心问题,包含18,000组查询-回复对,覆盖12种离散情感类别,并提供了合成音频及文本转录。作为Sympatheia项目的关键资源,它填补了情感感知语音对话领域缺乏大规模、细粒度标注语料库的空白,为开发能够理解并回应用户情绪状态的智能语音助手提供了重要数据支撑,对提升人机交互的自然度与共情能力具有深远影响。
当前挑战
该数据集所解决的领域挑战在于:现有语音对话系统多忽略情感上下文,难以生成与用户情绪匹配的共情回应。Sympatheia-18k通过引入‘用户情感’标签,即使在查询语音为中性风格时也能推断潜在情绪,从而支持情感一致的回复生成。构建过程中面临的挑战包括:确保情感类别的准确映射,采用了程序化定义的效价-唤醒(Valence-Arousal)映射,而非人工标注,这可能导致情感维度表征的偏差;同时,合成音频需在自然度与情感表达间取得平衡,避免因人工合成而降低情感真实性,从而影响下游模型对情感线索的学习效果。
常用场景
经典使用场景
Sympatheia-18k 数据集专为情感感知的共情语音对话研究而设计,其最经典的使用场景在于构建和评估能够识别用户情绪状态并生成相应情感反应的语音对话系统。该数据集包含18,000个查询-响应对,覆盖12种情感类别,并提供了合成音频与文本转录,使得研究者能够训练模型在语音层面捕捉细腻的情感变化,并生成与用户情绪相匹配的共情回应。通过‘Emotional’和‘Neutral’两个子集,数据集特别支持了从带有情感表达或中性表达的查询中推断用户真实情绪的任务,为情感语音合成与共情对话系统的交叉领域提供了标准化的训练与评估基准。
衍生相关工作
围绕 Sympatheia-18k 数据集,已衍生了多个经典的相关工作,其中最为突出的是与其配套的 Sympatheia 模型——一款情感感知的共情语音对话系统。该模型利用数据集提供的预编码音频令牌和情感标签,实现了从用户情感识别到共情语音生成的完整流程。此外,基于该数据集,研究者还探索了从中性语音中推断隐含情绪(即‘Neutral’子集的核心任务)的方法,推动了语音情感识别领域向更贴近实际场景的方向发展。这些工作不仅验证了数据集在情感对话系统构建中的有效性,也为后续研究提供了可复现的基准和启发性的技术路径。
数据集最近研究
最新研究方向
Sympatheia-18k数据集聚焦于情感感知共情语音对话的前沿研究,通过构建包含12种离散情感类别的18,000组查询-响应对,为情感语音合成与多模态人机交互提供了关键资源。该数据集创新性地设计了情绪匹配与中性查询触发多样化情感响应的双轨结构,结合GLM-4-Voice音频编码技术,推动了情感语音系统在细粒度情感理解与自然共情生成方面的突破。当前研究趋势集中于利用该数据集优化语音对话系统的情感表达真实性与上下文适应性,其意义在于为人机交互中的情感计算与共情式AI发展奠定了数据基础,尤其在心理健康辅助、情感陪伴等热点应用领域展现出广阔前景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务