遇见数据集

CCSEMO

收藏
github2026-07-01 更新2026-07-18 收录
官方服务:

资源简介:

CCSEMO 是一个中文心理咨询语音情感数据集和标注框架,专注于真实世界咨询对话中的情感表达,这些表达通常微妙、自然且依赖于上下文。该资源支持数据集标注、标注系统部署和基线语音情感识别实验。

CCSEMO is a Chinese psychological counseling speech emotion dataset and annotation framework that focuses on emotional expressions in real-world counseling dialogues. These expressions are typically subtle, natural, and context-dependent. This resource supports dataset annotation, annotation system deployment, and baseline speech emotion recognition experiments.

创建时间:
2026-06-29
原始信息汇总

数据集概述:CCSEMO

CCSEMO 是一个中文心理咨询语音情感数据集及标注框架,专注于真实咨询对话中的微妙、自然且依赖上下文的情绪表达。

仓库内容

该仓库提供以下资源:

  • 标注系统代码
    • CCSEMO_Official_Annotation_System_Code.zip:官方标注系统代码,包含语音片段标注、标注员测试、管理及质量控制相关功能的正式标注平台。
    • CCSEMO_Experimental_Annotation.zip:实验性标注系统代码及辅助材料。
  • 基线实验代码
    • CCSEMO_Continuous_Emotion_Recognition_Baseline.zip:连续情绪识别基线代码,包括基于预训练语音模型和音高特征融合的效价-唤醒度(Valence-Arousal)预测。
    • CCSEMO_Discrete_Emotion_Recognition_Baseline.zip:离散情绪分类基线代码,包括4类和7类语音情绪识别。
  • 许可协议
    • License Agreement_CCSEMO_SIAT.docx:用于申请访问CCSEMO数据集的标准许可协议模板。

数据集获取

  • 使用目的:数据集仅限研究用途。
  • 申请流程:研究人员需填写并签署许可协议,通过电子邮件发送至 huanraozhineng2@siat.ac.cn。
  • 协议要求:签署的协议需包含申请人姓名、职称、机构、地址、邮箱、手写签名及日期。
  • 限制条款:未经AIMSL, SIAT书面许可,不得将数据集用于商业目的、再分发、发布、复制、再许可或提供给第三方。

关联论文

该仓库配套论文: CCSEMO: A Chinese Counseling Speech Emotion Dataset annotated via a unified standardized annotation framework 发表于 Pattern Recognition (2026),论文介绍了CCSEMO数据集、标准化标注框架及平衡后的CCSEMO-mini子集。

标注界面预览

系统提供两种任务界面:

  1. 离散情绪标注界面:用于分类情绪标签标注。 离散情绪标注界面
  2. 连续情绪标注界面:用于效价-唤醒度(Valence-Arousal)标注。 连续情绪标注界面
搜集汇总
数据集介绍
CCSEMO 数据集图片
构建方式
CCSEMO数据集聚焦于真实心理咨询对话场景,其构建基于一套统一的标准化标注框架。研究团队首先采集了心理咨询过程中的真实语音数据,随后开发了专用的标注系统,该系统涵盖离散情感标注与连续情感标注两种界面,分别用于分类情感标签和效价-唤醒度维度的标注。标注流程中集成了标注者测试、管理及质量控制功能,以确保标注的一致性和可靠性。此外,通过实验性标注系统的前期探索,最终形成了正式的标注工作流,并在此基础上构建了平衡的CCSEMO-mini子集。
特点
CCSEMO数据集的核心特点在于其面向真实心理咨询场景中的微妙、自然且依赖于上下文的情感表达。与实验室环境下表演式情感数据不同,该数据集反映了咨询对话中情感的细腻变化和复杂性。数据集支持离散情感分类(4类和7类)与连续维度预测(效价-唤醒度)两种标注范式,为情感计算研究提供了多维度的信息。同时,数据集仅供研究用途,需签署许可协议方可获取,严格限制了商业应用和第三方传播,保障了数据使用的伦理规范。
使用方法
研究人员可通过发送已签署的许可协议至指定邮箱(huanraozhineng2@siat.ac.cn)申请CCSEMO数据集访问权限。获取数据后,可结合仓库提供的基线实验代码进行使用,其中包括基于预训练语音模型与音高特征融合的连续情感识别基线,以及面向4类和7类任务的离散情感分类基线。仓库还提供了标注系统的部署代码,支持研究者复现标注流程或进行情感标注工作。所有代码与数据集均需遵循非排他性许可协议条款,仅限于学术研究目的。
背景与挑战
背景概述
CCSEMO数据集于2026年由中国科学院深圳先进技术研究院(SIAT)的Guo Zhixing、Liu Yang等研究人员创建,旨在填补中文心理咨询对话中情感分析研究的空白。该领域长期面临情感表达微妙、自然且依赖上下文的挑战,传统情感数据集多基于表演或实验室环境,难以捕捉真实咨询场景中细腻的情感动态。CCSEMO聚焦于真实咨询对话,通过统一标准化标注框架,为离散情感分类与连续效价-唤醒度预测提供了高质量标注资源。其发布推动了中文情感计算与心理健康领域的交叉研究,为开发更具生态效度的语音情感识别模型奠定了基石,并对心理咨询自动化评估的学术探索产生了重要影响。
当前挑战
CCSEMO数据集所解决的领域挑战在于,真实心理咨询对话中的情感表达常具有低强度、高混合性及语境依赖性,传统离散标签难以刻画其连续变化,且跨标注者一致性难以保证。构建过程中,研究人员面临标注框架设计的复杂性,需兼顾离散与连续标注维度,同时开发专用标注系统以支持标注员测试、管理及质量控制。此外,法律与伦理挑战突出,包括签署许可协议以限制数据仅用于研究、防止商业滥用或第三方传播,并确保患者隐私与数据安全。这些挑战共同促使CCSEMO在标注体系、系统架构及合规管理上进行了创新性设计。
常用场景
经典使用场景
在心理咨询这一高度依赖情感洞察的领域,CCSEMO数据集专为捕捉真实咨询对话中微妙、自然且高度依赖上下文的情绪表达而设计。其经典使用场景聚焦于语音情感识别任务,涵盖离散情绪分类(如四类和七类情绪标签预测)与连续情绪识别(如效价- arousal维度预测)。研究者可利用该数据集训练和评估基线模型,通过融合预训练语音特征与音高信息,深入探究咨询场景下情感动态变化的建模方法。
解决学术问题
CCSEMO数据集系统性地解决了心理咨询语音情感识别研究中缺乏高质量中文标注语料库的核心困境。此前,该领域常因情绪表达隐晦、标注标准不一而面临模型泛化性差的难题。通过提供统一标准化标注框架和严格的质控流程,该数据集有效提升了标注的一致性与可靠性,为构建稳健的情绪分析模型奠定了数据基础,推动了对话情感计算理论在心理健康领域的学术发展。
衍生相关工作
围绕CCSEMO数据集,衍生出了一系列具有影响力的经典工作。相关研究不仅验证了基线模型在连续与离散情绪识别任务中的有效性,还探讨了预训练模型与音高特征融合对识别性能的提升机制。此外,基于该数据集的标注框架,部分工作进一步探索了跨文化咨询场景下的情绪标注一致性,以及弱监督学习在少样本咨询语音情绪识别中的应用,丰富了对话情感计算的方法论体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务