遇见数据集

Molweni

收藏
arXiv2020-11-07 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

Molweni数据集是由哈尔滨工业大学和新加坡国立大学合作创建的,专注于多方对话的机器阅读理解(MRC)。该数据集源自Ubuntu Chat Corpus,包含10,000个对话,总计88,303条发言,并标注了30,066个问题,包括可回答和不可回答的问题。Molweni独特之处在于其对所有多方对话进行了话语依赖性标注,采用改进的Segmented Discourse Representation Theory(SDRT)风格,共标注了78,245个话语关系。数据集主要用于解决多方对话的话语解析问题,挑战现有的MRC模型,特别是在处理非连续性和复杂结构的话语关系时。

The Molweni dataset was collaboratively developed by Harbin Institute of Technology and National University of Singapore, specializing in multi-party dialogue machine reading comprehension (MRC). Derived from the Ubuntu Chat Corpus, this dataset consists of 10,000 dialogues totaling 88,303 utterances, and is annotated with 30,066 questions covering both answerable and unanswerable cases. What distinguishes Molweni is its annotation of utterance dependencies across all multi-party dialogues in the style of improved Segmented Discourse Representation Theory (SDRT), with a total of 78,245 utterance relationships labeled. This dataset is primarily designed to tackle the problem of utterance parsing for multi-party dialogues, and poses challenges to existing MRC models, particularly when handling discontinuous and structurally complex utterance relationships.

提供机构:
哈尔滨工业大学
创建时间:
2020-04-10
搜集汇总
数据集介绍
Molweni 数据集图片
构建方式
Molweni数据集源自Ubuntu聊天语料库,这是一个大规模的多方对话数据集。研究团队从中筛选出包含8至15个话轮、2至9位发言人的复杂对话,并剔除了话轮长度超过20个单词的样本,最终随机选取了约10,000段对话,共计88,303个话轮。在此基础上,十名计算机专业的本科生担任标注员,为每段对话提出三个问题(涵盖可回答与不可回答两类),并标注答案在源对话中的连续片段。同时,所有对话均按照修正后的分段话语表征理论(SDRT)进行了话语依赖关系标注,共获得78,245条话语关系。
使用方法
使用Molweni时,可将对话中的所有话轮按顺序拼接成段落作为输入,每个话轮需包含发言者标识和文本内容,用于机器阅读理解任务。模型需从拼接后的文本中定位答案片段,或判断问题不可回答。对于话语解析任务,则需预测话轮间的话语依赖边及关系类型,构建有向无环图。数据集已划分为训练集(8,771段对话)、开发集(883段)和测试集(100段,由所有标注员共同标注),可直接用于训练和评估。官方代码基于BERT实现,建议采用全词掩码(wwm)版本以获得最佳基线性能。
背景与挑战
背景概述
Molweni数据集由哈尔滨工业大学、新加坡国立大学及鹏城实验室的研究人员于2020年联合创建,旨在填补多轮多方对话机器阅读理解领域的数据空白。不同于传统基于书面语篇的阅读理解任务,Molweni聚焦于多说话人对话中话语间复杂的图状篇章结构,其核心研究问题在于如何让模型理解对话中非相邻话语间的依赖关系,并回答可回答与不可回答两类问题。该数据集从Ubuntu对话语料库中筛选了约一万段对话,包含八万余条话语和三万余个问题,并额外标注了七万八千余条篇章依存关系,成为迄今为止规模最大的多方对话篇章解析资源。Molweni的发布显著推动了对话阅读理解与篇章解析的交叉研究,其挑战性已通过BERT-wwm模型仅67.7%的F1得分得到验证,较其在SQuAD 2.0上的表现下降逾20%。
当前挑战
Molweni数据集面临的核心挑战体现在两个层面。领域层面,多方对话中话语间的局部连贯性远弱于书面语篇,相邻话语可能不存在篇章关系,而远距离话语却可能形成依赖,这要求模型突破线性文本假设,构建图状篇章表示以正确理解对话意图。构建层面,标注过程需同时处理阅读理解与篇章结构两项任务:一方面,对话中非相邻话语的篇章关系识别依赖标注者对全局结构的把握,导致标注一致性面临考验(如关系类别标注的Kappa值仅为0.56);另一方面,技术性对话(如Ubuntu社区内容)的语法错误和口语化表达增加了问答对设计的难度,需通过多轮人工与程序化校验确保数据质量。此外,不可回答问题的引入进一步加剧了模型对对话深层语义建模的挑战。
常用场景
经典使用场景
在多模态对话与自然语言处理的交汇领域,Molweni数据集被广泛用于多方对话场景下的机器阅读理解任务。其核心价值在于将非结构化的多轮对话转化为可推理的问答形式,例如,给定包含多个发言者的技术讨论记录,模型需从冗长且话题跳跃的对话中定位答案片段。该数据集特别强调对不可回答问题的标注,迫使模型具备识别信息缺失的能力,从而模拟真实对话中信息不完整的常见困境。
解决学术问题
Molweni的提出填补了多方对话机器阅读理解领域的关键空白。传统阅读理解数据集(如SQuAD)基于线性文本,假设相邻句子间存在连贯性,而多方对话中发言者交替、话题分散,导致局部连贯性缺失。Molweni通过标注大规模话语依存结构(78,245条关系),首次将图结构的对话建模引入阅读理解任务,解决了模型无法捕捉非相邻话语间语义关联的难题。研究表明,即使强大的BERT-wwm模型在Molweni上的F1值仅达67.7%,远低于其在SQuAD 2.0上的表现,凸显了该数据集对推动对话结构理解研究的挑战性意义。
实际应用
在实际应用中,Molweni为构建智能客服、会议纪要生成及协作对话系统提供了重要基准。例如,技术论坛的自动问答系统可利用该数据集训练模型,从多用户讨论中提取问题对应的解决方案;会议记录工具需理解发言者间的引用与回应关系,Molweni中的话语依存标注恰好支持此类图结构推理。此外,该数据集还可用于对话质量评估,通过检测未回答问题识别信息漏报,提升人机交互的鲁棒性。
数据集最近研究
最新研究方向
近年来,多轮对话系统与机器阅读理解领域的交叉研究日益成为自然语言处理的前沿热点。Molweni数据集正是在这一背景下应运而生,它构建于大规模多轮对话语料Ubuntu Chat Corpus之上,创新性地融合了话语结构标注与阅读理解任务。当前,Molweni的研究方向主要聚焦于两大挑战:其一,如何有效建模多轮对话中复杂的非线性和非局部连贯性,以突破传统序列模型(如BERT)在对话理解上的性能瓶颈;其二,利用其提供的78,245条话语关系标注,推动多轮对话话语解析任务从有限规模(如STAC)迈向大规模数据驱动的方法。Molweni的提出不仅揭示了现有模型在对话式机器阅读理解上的显著不足(BERT-wwm的F1值仅67.7%,远低于人类表现),更为对话系统在复杂场景下的语义理解与推理能力提升提供了关键基准与新的研究范式。
相关研究论文
  • 1
    Molweni: A Challenge Multiparty Dialogues-based Machine Reading Comprehension Dataset with Discourse Structure哈尔滨工业大学 · 2020年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务