LUNA Corpus Discourse Data Set
收藏资源简介:
LUNA Corpus Discourse数据集包含来自意大利LUNA人机交互语料库的60个对话,这些对话来自硬件/软件帮助台领域,并遵循Penn Discourse Treebank (PDTB)指南进行标注。数据集总共包含1,606个话语关系,其中1,052个是显式话语关系。对话被分为训练、开发和测试集,分别为42、6和12个。
The LUNA Corpus Discourse dataset comprises 60 dialogues sourced from the Italian LUNA human-computer interaction corpus, specifically from the hardware/software helpdesk domain. These dialogues are annotated following the guidelines of the Penn Discourse Treebank (PDTB). The dataset contains a total of 1,606 discourse relations, with 1,052 being explicit discourse relations. The dialogues are divided into training, development, and test sets, consisting of 42, 6, and 12 dialogues respectively.
数据集概述
名称: LUNA Corpus Discourse Data Set
领域: 硬件/软件帮助台
语言: 意大利语
对话数量: 60
注释遵循: Penn Discourse Treebank (PDTB) 指南
包含的论述关系数量: 1,606
明确论述关系数量: 1,052
数据集结构
对话分割:
- 训练集: 42 对话
- 开发集: 6 对话
- 测试集: 12 对话
数据格式:
- 每个对话以JSON文件存储,包含以下字段:
DOC_ID: 文件名的数字部分tokens: 扁平化的词列表blocks: 文本文件中块的词起始和结束索引列表(制表符分隔)groups: 文本文件中组的词起始和结束索引列表(换行符分隔)relations: 论述关系列表
论述关系类型
类型分布:
| 类型 | 总数 | 训练 | 开发 | 测试 |
|---|---|---|---|---|
| Explicit | 1,052 | 659 | 135 | 258 |
| Implicit | 490 | 294 | 74 | 122 |
| AltLex | 11 | 8 | 2 | 1 |
| EntRel | 56 | 33 | 7 | 16 |
论述关系感官
感官分布:
| 类型 | 总数 | 0 | 1s | 2s | 2c |
|---|---|---|---|---|---|
| Explicit | 1,052 | 4 | 1,045 | 3 | NA |
| Implicit | 490 | 3 | 481 | 3 | 3 |
| AltLex | 11 | 1 | 10 | NA | NA |
| EntRel | 56 | NA | NA | NA | NA |
论述关系感官选择
- 所有论述关系简化为具有精确的1个感官(或0,如果缺失)。
- 如果存在多个感官,选择第一个。
- 对于具有两个连接词的隐含关系,选择第一个连接词的第一个感官。
论述关系感官级别
级别1感官:
- PDTB有4个级别1感官:比较、偶然性、扩展和时间性。
- LUNA添加了3个仅有一个级别的感官:论述标记、中断、重复。
级别2和级别3+感官:
- 大多数关系具有级别2感官,但有些仅具有级别1感官。
- 级别3感官进一步细分类别,如比较.让步.认识论让步。
数据匿名化
- 数据在词级别进行匿名化,使用特定替换规则。
参考文献
- 如果使用此数据集进行出版,请引用Tonelli等人的论文。




