遇见数据集

DuQM

收藏
arXiv2022-05-25 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

DuQM是一个由百度公司创建的中文数据集,旨在通过语言学扰动评估问题匹配模型的鲁棒性。该数据集包含来自商业搜索引擎的自然问题,具有3个类别和13个子类别,共32种语言扰动。DuQM的设计允许对模型的语言能力进行全面评估,特别关注模型在自然文本上的表现,而非人工构造的文本。此数据集的应用领域主要集中在提高模型对自然语言处理任务的鲁棒性,特别是在面对语言扰动时的稳定性和准确性。

DuQM is a Chinese dataset developed by Baidu Inc. for evaluating the robustness of question matching models through linguistic perturbations. It comprises natural questions collected from commercial search engines, covering 3 main categories, 13 subcategories, and a total of 32 types of linguistic perturbations. The design of DuQM allows for a comprehensive assessment of models' linguistic capabilities, with a special emphasis on the models' performance on natural text rather than manually crafted text. The primary application scope of this dataset lies in improving the robustness of models in natural language processing tasks, particularly their stability and accuracy when confronted with linguistic perturbations.

提供机构:
百度公司
创建时间:
2021-12-16
搜集汇总
数据集介绍
DuQM 数据集图片
构建方式
DuQM的构建始于从商业搜索引擎的搜索日志中收集大量自然问题作为源数据。首先,对这些源问题进行词性标注、命名实体识别、依存句法分析和词重要性分析等一系列语言学预处理,以获取其内在的语言学知识。随后,依据词汇、句法和语用三大范畴下的13个子类别,针对性地采用替换、插入和交换三种扰动操作生成问题对。为确保生成句子的自然性,所有扰动后的问题均需在搜索日志中确认为用户真实输入。最终,由内部语言学专家团队对问题对进行流畅性、语法正确性及类别准确性的审核,并由三位专家进行语义等价性标注,采用多数投票制决定标签,并通过10%的随机抽样复核确保标注质量,最终构建出包含10,121个样本的DuQM数据集。
特点
DuQM数据集的核心特点在于其系统性、细粒度和自然性。系统性体现在它覆盖了词汇、句法和语用三大语言学范畴,包含13个子类别和32种具体的语言扰动操作,能够全面评估模型在不同语言学现象上的表现。细粒度则表现为数据按语言学现象进行了精细划分,使得研究者可以深入诊断模型在词性理解、命名实体识别、同义反义辨析、否定推理、时态处理、句法对称性、语态变换以及语用层面如拼写错误和话语标记等方面的优势与短板。自然性是该数据集区别于人工对抗样本的关键,所有问题均源自真实用户搜索,确保了评估结果能真实反映模型在实际应用场景中的鲁棒性。
使用方法
DuQM主要用于评估和诊断中文问题匹配模型的鲁棒性。使用时,研究者首先在通用领域的数据集(如LCQMC)上对预训练模型进行微调,然后将微调后的模型在DuQM的全部样本上进行评估,计算整体准确率。更重要的是,利用DuQM的细粒度标签,可以按词汇、句法、语用三大范畴及其下的13个子类别分别计算微平均和宏平均准确率,从而获得模型的详细性能剖面图。通过对比不同模型在同一语言学扰动下的表现,或同一模型在不同扰动上的差异,研究者能够精准定位模型的薄弱环节。此外,DuQM还可作为对抗训练效果的评估基准,用于检验人工对抗样本增强方法是否能在自然文本上带来实质性的鲁棒性提升。
背景与挑战
背景概述
在自然语言处理领域,问题匹配(Question Matching, QM)任务旨在判定语义等价的问句对,广泛应用于智能客服与社区问答等场景。尽管基于预训练模型的神经方法在LCQMC等基准数据集上表现卓越,但其在真实自然文本中的鲁棒性始终是悬而未决的难题。为填补中文QM鲁棒性评估语料的空白,百度公司与苏州大学的研究团队于2022年联合构建了DuQM数据集。该数据集创新性地从商业搜索引擎的海量真实用户查询中,系统性地引入了涵盖词汇、句法及语用三大类别的32种语言扰动,旨在全面诊断模型在自然语境下的基础语言能力。这一开创性工作为评估QM模型的真实鲁棒性提供了更具区分度与诊断价值的测试基准。
当前挑战
DuQM数据集面临的核心挑战源于其对自然语言复杂性的深度刻画。在领域问题层面,传统QM模型常受限于仅对人工对抗样本的评估,而DuQM要求模型在真实自然文本中具备对同义词替换、否定结构、时序推理及语态变换等32种细微语言变化的精准判别能力,这对模型捕获词汇、句法与语用特征的鲁棒性提出了严苛考验。在构建过程中,挑战则体现在如何从海量搜索日志中筛选自然问句,并确保生成扰动句的语义连贯性与语法正确性。为此,研究团队需借助词性标注、依存句法分析及人工审查等多重机制,在十万余候选样本中仅保留万例高质量数据,同时保证标注一致性,其繁琐程度可见一斑。
常用场景
经典使用场景
在自然语言处理领域,问题匹配模型的鲁棒性评估长期依赖于人工构造的对抗样本,这些样本往往局限于单一或少数几种语言扰动类型,难以全面反映模型在真实文本上的表现。DuQM数据集应运而生,它通过系统性地引入32种语言扰动,涵盖词汇、句法和语用三大类别,为中文问题匹配模型提供了一个细粒度、多样化的鲁棒性测试平台。其最经典的用法在于,研究者可基于该数据集对模型进行全面的语言能力诊断,通过对比模型在各类扰动下的准确率差异,精准定位其在词义理解、句法结构识别、语用推理等方面的优势与不足。
衍生相关工作
DuQM的发布催生了一系列相关研究工作的涌现。在评估框架层面,它启发了研究者构建类似的中文语言能力诊断基准,如针对自然语言推理和机器阅读理解任务的鲁棒性测试集。在模型改进方面,DuQM揭示的模型弱点(如时间推理能力不足、对非对称句法结构敏感度低)直接推动了针对性的数据增强策略和预训练目标优化方法的发展。例如,MacBERT模型在预训练阶段引入相似词掩码策略,显著提升了同义词替换场景下的鲁棒性,这一思路正是受到DuQM细粒度诊断结果的启发。此外,该数据集还促进了对抗训练方法的反思,促使研究者从人工对抗样本转向更自然的语言扰动生成技术。
数据集最近研究
最新研究方向
在中文问答匹配领域,模型鲁棒性评估正从单一对抗样本测试向系统性、细粒度的语言能力诊断转变。DuQM数据集通过构建涵盖词汇、句法和语用三大类、13个子类、32种语言扰动的自然问句对,开创性地实现了对模型在真实搜索场景下语言理解能力的全面剖析。该数据集的前沿价值在于,它不仅揭示了当前预训练模型在时间推理、非对称句法结构等复杂语言现象上的显著短板,还实证了传统人工对抗训练方法在自然文本上的失效性。这一研究方向推动领域从追求静态准确率转向动态鲁棒性诊断,为构建更贴近真实应用需求的鲁棒问答系统奠定了关键评估基石。
相关研究论文
  • 1
    DuQM: A Chinese Dataset of Linguistically Perturbed Natural Questions for Evaluating the Robustness of Question Matching Models百度公司 · 2022年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务