遇见数据集

PALRACE

收藏
arXiv2022-03-24 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

PALRACE是一个包含800篇阅读理解文章的数据集,由浙江大学创建,旨在提升机器阅读理解(MRC)任务的可解释性。该数据集的特点是每篇文章都附有人类标注的词级理由(rationale),这些理由由至少26名读者标注,用于支持答案的选择。数据集中的文章来自RACE数据集,涵盖多种问题类型,如因果、事实、推理等。PALRACE的创建不仅支持了理由的监督学习,还为评估模型在定位和解释信息方面的能力提供了标准。此数据集的应用领域主要集中在提高MRC模型的解释性和性能,尤其是在模型未达到最先进性能时,通过人类理由的辅助,可以显著提升模型的表现。

PALRACE is a dataset consisting of 800 reading comprehension articles, created by Zhejiang University, with the goal of enhancing the interpretability of machine reading comprehension (MRC) tasks. A distinctive feature of this dataset is that each article is paired with human-annotated word-level rationales, which are labeled by at least 26 readers to justify the selection of answers. The articles in the PALRACE dataset are sourced from the RACE dataset, covering various question types including causal, factual, inferential, and others. The development of PALRACE not only supports supervised learning for rationales, but also establishes a standard benchmark for evaluating models' capabilities in locating and interpreting information. The primary application scenarios of this dataset focus on improving the interpretability and performance of MRC models; particularly when the model has not yet achieved state-of-the-art performance, the assistance of human rationales can significantly boost the model's performance.

提供机构:
浙江大学
创建时间:
2021-06-23
搜集汇总
数据集介绍
PALRACE 数据集图片
构建方式
PALRACE数据集源自RACE测试集中的高中水平篇章,经两名英语文学专业研究生人工筛选与校验,剔除存在错误答案或可脱离篇章作答的题目,最终保留800个篇章-问题对。问题被划分为六类:局部型(因果、事实、推理)与全局型(主题、标题、目的)。每篇篇章由至少26名参与者进行词级标注,每人限标注5个关键词,并通过延迟评估环节验证标注质量——参与者在仅能查看标注词的情况下回答题目,平均正确率达73.41%,证实标注词足以支撑作答。
特点
该数据集的核心特色在于其精细的标注粒度与多标注者共识机制:每个词被标注的次数被记录,最终选取被标注频次最高的5个词作为理性依据。此外,数据集提供两种理性依据形式——词级与句级,以适应不同模型需求。实验表明,人类理性依据能显著提升模型性能,尤其对未微调或简单的模型(如GloVe嵌入模型)提升幅度超30%,且使模型对微调方式的敏感度降低,增强了鲁棒性。
使用方法
研究者可将篇章与问题以[CLS]篇章[SEP]问题、选项[SEP]格式输入,通过线性层与softmax对四个选项进行评分。为利用理性依据,可将原始篇章替换为词级或句级理性依据,并采用10折交叉验证进行微调(70%训练、20%开发、10%测试)。该数据集特别适用于训练可解释的机器阅读理解模型,使其在给出答案的同时提供支撑性依据,从而提升决策透明度与可靠性。
背景与挑战
背景概述
PALRACE数据集由浙江大学与浙江实验室的研究人员于2021年创建,旨在解决机器阅读理解(MRC)模型可解释性不足的问题。该数据集从RACE数据集中精选了800篇高中水平的篇章,每篇配备一个多项选择题,并由至少26名具备英语能力证明的参与者标注了词级别的关键证据(rationales)。核心研究问题在于探究人工标注的rationales是否能提升MRC模型的性能,并支持可解释模型的监督学习。PALRACE将问题细分为因果、事实、推理等六种类型,覆盖局部与全局理解,为评估模型的信息定位与解读能力提供了独特视角。该数据集在ACL-IJCNLP 2021上发布,对推动可解释自然语言处理领域具有重要影响力。
当前挑战
PALRACE面临的核心挑战包括:1)领域问题方面,现有预训练语言模型在MRC任务中虽表现优异,但缺乏可解释性与鲁棒性,难以定位篇章中的关键信息,而人工rationales的引入虽能提升性能,但如何使模型自主生成高质量的rationales仍是一大难题。2)构建过程中,数据集从RACE中筛选篇章时需人工验证答案正确性并剔除可猜测的题目,耗时耗力;标注实验要求179名参与者在相隔一周的两次会话中完成标注与评估,确保rationales的充分性,但标注质量受限于参与者的英语水平与专注度,且每个参与者仅能标注至多5个词,导致rationales的覆盖范围有限。
常用场景
经典使用场景
在机器阅读理解(MRC)领域,PALRACE数据集的核心应用在于为模型提供细粒度的人工标注理由,从而支持可解释性研究。该数据集从RACE测试集中精选800篇高中难度篇章,涵盖因果、事实、推理、主题、标题和目的六类问题,每篇由至少26名标注者以词级粒度标注关键理由。通过将篇章替换为理由(词级或句级),研究者可评估模型在仅依赖关键信息时的回答能力,这为探究模型定位与理解信息的机制提供了标准化测试平台。
实际应用
在实际应用中,PALRACE可用于构建教育领域的智能辅导系统,例如辅助学生理解英语阅读理解题,通过分析模型给出的理由提供个性化反馈。此外,该数据集在司法文书分析、医学文献问答等需要可解释决策的领域具有潜力,因为其理由标注机制可帮助开发鲁棒且透明的系统。在内容审核场景中,模型基于理由的推理可减少误判,提升对争议性文本的判别可靠性。
衍生相关工作
PALRACE衍生工作主要围绕可解释MRC和理由增强学习展开。例如,ERASER基准(DeYoung等)评估理由化NLP模型,而PALRACE通过多标注者词级理由填补了其细粒度标注的空白。后续研究借鉴其理由质量验证方法(如行为测试),开发了基于对抗训练的理由生成模型。此外,PALRACE中理由对局部问题(如事实、推理)的显著提升,催生了针对信息定位能力的专项优化工作,如引入注意力蒸馏或理由感知的预训练目标。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务