Emotion Transcription in Conversation Dataset
收藏资源简介:
Emotion Transcription in Conversation Dataset 是一个包含约1,000件日语对话的数据集,其中每个对话中的发言都附有说话者自己描述的心情文。此外,数据集还包括基于心情文的感情标签和说话者的性格特性(TIPI-J)。该数据集是为“对话中的心情描述(Emotion Transcription in Conversation; ETC)”任务构建的基准数据集。
The Emotion Transcription in Conversation (ETC) Dataset is a benchmark dataset developed for the "Emotion Transcription in Conversation (ETC)" task. It contains approximately 1,000 Japanese conversations, where each utterance in the conversations is paired with the speaker's self-reported mood description. Additionally, the dataset includes emotion labels derived from these mood descriptions, as well as the personality traits of the speakers (TIPI-J).
Emotion Transcription in Conversation Dataset 概述
数据集简介
Emotion Transcription in Conversation Dataset 是一个日语对话数据集,包含约1,000个对话。其核心特点是每个对话回合的发言均附有由说话者本人描述的心情文本。此外,数据集还包含基于心情文本的情感标签以及说话者的性格特征(TIPI-J)。该数据集是专为“对话中的心情描述”任务构建的基准数据集。
关键统计信息
- 对话数量:997 个对话
- 说话者数量:198 名
- 发言数量 / 心情文数量:9,970 条
- 每对话发言数:10 条发言
- 发言平均长度(字符数):42.72 字符
- 说话者:44.65 字符
- 倾听者:40.79 字符
- 心情文平均长度(字符数):28.88 字符
- 说话者:28.91 字符
- 倾听者:28.85 字符
- 情感类别数量:7类(Ekman的6种基本情感 + “无对应”)
- 语言:日语
数据构成
数据存储在 etc/ 目录下,主要包括对话数据和说话者性格特征数据。
对话数据
- 位置:
etc/dialogues/*.json(每个文件对应一个对话) - 内容:每个对话包含参与者ID、发言文本、心情文本和情感标签。
- 对话结构:对话以说话者的发言开始,说话者和倾听者交替发言(每个对话共10轮发言)。
- 收集设置:采用EmpatheticDialogues的对话设置,为说话者指定了特定的情感标签(共32种)。
- 情感标注:情感标签基于Ekman的6种基本情感(喜悦、悲伤、恐惧、愤怒、惊讶、厌恶)加上“无对应”共7类。每条心情文由3名标注者以多标签形式进行标注。
- 数据字段:
dialogue_id:对话IDdialogue_emotion:对话进行时指定的情感标签participants:包含说话者(speaker)和倾听者(listener)ID的字典dialogue:发言信息列表,每项包含:turn:回合编号role:角色(speaker或listener)utterance:发言文本emotion_transcription:发言时说话者的心情文本emotions:心情文所表达的情感标签列表(3名标注者的多标签结果)
说话者性格特征数据
- 位置:
etc/personality_traits.json - 内容:包含TIPI-J(日语版十项人格量表)的问卷项目、说话者的回答以及据此计算出的Big Five人格特质得分。
- 数据字段:
item:问卷项目字典(i01至i10)personality:以说话者ID为键的性格特征数据字典,每个ID下包含:participant_id:说话者IDresponse:对各问卷项目的回答score:Big Five各维度得分(开放性、勤勉性、外向性、协- 调性、神经质倾向),分值范围2-14。
数据分割信息
- 位置:
etc/split.json - 内容:记录了相关论文实验中使用的训练集、验证集和测试集分割信息。
使用许可与引用
- 许可证:本数据集基于 CC BY-NC 4.0 许可证提供。
- 引用要求:使用本数据集发表研究成果时,需引用指定的论文(标题:対話における心情記述: 自然言語による機微かつ複雑な心情理解のためのベンチマーク,作者:田中 義規 等,会议:言語処理学会第32回年次大会,年份:2026)。
重要注意事项
- 数据集中的对话内容通过众包收集,不代表数据集创建者或其所属机构的信念或观点。
- 公开版本的数据已进行质量检查,并出于伦理考虑移除了被认为有问题的对话。相关论文中的分析基于移除前的数据集,统计信息可能与公开版不同。
- 说话者姓名已被替换为数据集创建者分配的匿名ID。
- 使用本数据集时,严禁:
- 试图从数据中识别特定个人。
- 将数据集用于冒充特定说话者。
- 在用于说话者性格特征推断等用途时,忽视不希望自身信息被推断的说话者的权利。




