遇见数据集

hfl/expmrc

收藏
Hugging Face2024-05-28 更新2024-06-12 收录
官方服务:

资源简介:

--- license: cc-by-sa-4.0 task_categories: - question-answering language: - zh - en --- ## GitHub repository: https://github.com/ymcui/expmrc With the development of the pre-trained language models (PLMs), achieving human-level performance on several machine reading comprehension (MRC) dataset is not as hard as it used to be. However, the explainability behind these artifacts still remains unclear, raising concerns on utilizing these models in real-life applications. To improve the explainability of MRC tasks, we propose ExpMRC benchmark. **ExpMRC** is a benchmark for **Exp**lainability Evaluation of **M**achine **R**eading **C**omprehension. ExpMRC contains four subsets of popular MRC datasets with additionally annotated evidences, including [SQuAD](https://www.aclweb.org/anthology/D16-1264/), [CMRC 2018](https://www.aclweb.org/anthology/D19-1600/), RACE<sup>+</sup> (similar to [RACE](https://www.aclweb.org/anthology/D17-1082/)), and [C<sup>3</sup>](https://www.aclweb.org/anthology/2020.tacl-1.10/), covering span-extraction and multiple-choice questions MRC tasks in both English and Chinese. To achieve a higher score in ExpMRC, the model should not only give a correct answer for the question but also give a passage span as the evidence text. We greatly welcome the submission that could be generalized well on different languages and types of MRC tasks with *unsupervised* or *semi-supervised* approaches. **ExpMRC: Explainability Evaluation for Machine Reading Comprehension** - [Yiming Cui](https://ymcui.com), Ting Liu, Wanxiang Che, Zhigang Chen, Shijin Wang - Published in [Heliyon](https://www.cell.com/heliyon) [[Official Publication]](https://www.cell.com/heliyon/fulltext/S2405-8440(22)00578-3) [[arXiv pre-print]](https://arxiv.org/abs/2105.04126) [[**Leaderboard**]](https://ymcui.github.io/expmrc/) [[Papers With Code]](https://paperswithcode.com/dataset/expmrc) ## Submission to Leaderboard Please visit our leaderboard for more information: [https://ymcui.github.io/expmrc/](https://ymcui.github.io/expmrc/) To preserve the integrity of test results and improve the reproducibility, **we do not release the test sets to the public**. Instead, we require you to upload your model onto CodaLab, so that we can run it on the test sets for you. You can follow the instructions on CodaLab (which is similar to SQuAD, CMRC 2018 submission). You can submit your model on one or more subsets in ExpMRC. Sample submission files are shown in `sample_submission` directory. Submission policies: 1. You are free to use any open-source MRC data or automatically generated data for training your systems (both labeled and unlabeled). 2. You are **NOT** allowed to use any **publicly unavailable** human-annotated data for training. 3. We do not encourage using the development set of ExpMRC for training (though it is not prohibited). You should declare whether the system is trained by using the whole/part of the development set. Such submissions will be marked with an asterisk (*). ## Citation If you are using our benchmark in your work, please cite: ``` @article{cui-etal-2022-expmrc, title={ExpMRC: Explainability Evaluation for Machine Reading Comprehension}, author={Cui, Yiming and Liu, Ting and Che, Wanxiang and Chen, Zhigang and Wang, Shijin}, journal={Heliyon}, year={2022}, volume={8}, issue={4}, pages={e09290}, issn={2405-8440}, doi={https://doi.org/10.1016/j.heliyon.2022.e09290} } ``` ## Acknowledgment [Yiming Cui](https://ymcui.com) would like to thank [Google TPU Research Cloud (TRC)](https://g.co/tfrc) program for providing computing resource. We also thank [SQuAD team](https://rajpurkar.github.io/SQuAD-explorer/) for open-sourcing their website template. ## Contact us Please submit an issue.

许可证:CC BY-SA 4.0 任务类别: - 问答 语言: - 中文 - 英文 GitHub 仓库:https://github.com/ymcui/expmrc 随着预训练语言模型(pre-trained language models, PLMs)的发展,在多项机器阅读理解(machine reading comprehension, MRC)数据集上达到人类水平的性能已不再如往昔那般困难。然而,此类模型背后的可解释性依然模糊不清,这引发了学界与工业界对其落地应用的担忧。为提升MRC任务的可解释性,我们提出ExpMRC基准测试集。 **ExpMRC**,即**机器阅读理解可解释性评估(Explainability Evaluation of Machine Reading Comprehension)**,是一款面向机器阅读理解可解释性评估的基准测试集。ExpMRC收录了4个热门MRC数据集的子集,并额外附加了证据标注,涵盖[SQuAD](https://www.aclweb.org/anthology/D16-1264/)、[CMRC 2018](https://www.aclweb.org/anthology/D19-1600/)、RACE<sup>+</sup>(类似[RACE](https://www.aclweb.org/anthology/D17-1082/))以及[C<sup>3</sup>](https://www.aclweb.org/anthology/2020.tacl-1.10/),支持英文与中文两种语言,覆盖抽取式问答与多项选择式两类MRC任务。 若想在ExpMRC上获得更高得分,模型不仅需要给出问题的正确答案,还需提供对应的篇章片段作为证据文本。我们诚挚欢迎基于无监督或半监督方法,能够在不同语言与任务类型的MRC场景中实现良好泛化能力的模型提交。 **ExpMRC:机器阅读理解可解释性评估** - [崔一鸣](https://ymcui.com)、刘挺、车万翔、陈智刚、王仕进 - 发表于[Heliyon](https://www.cell.com/heliyon) [[官方出版物]](https://www.cell.com/heliyon/fulltext/S2405-8440(22)00578-3) [[arXiv预印本]](https://arxiv.org/abs/2105.04126) [[**排行榜**]](https://ymcui.github.io/expmrc/) [[Papers With Code]](https://paperswithcode.com/dataset/expmrc) ## 排行榜提交 请访问排行榜页面获取详细信息:[https://ymcui.github.io/expmrc/](https://ymcui.github.io/expmrc/) 为保障测试结果的公正性并提升研究可复现性,**我们不会公开测试集**。取而代之的是,我们要求您将模型上传至CodaLab平台,以便我们在测试集上运行您的模型。您可参考CodaLab平台上的提交指南(流程与SQuAD、CMRC 2018的提交方式类似)。您可选择ExpMRC的一个或多个子集进行模型提交。示例提交文件可在`sample_submission`目录中查看。 提交政策: 1. 您可自由使用任何开源MRC数据集或自动生成的数据(包括带标注与未带标注的数据)训练模型系统。 2. **严禁使用任何未公开的人工标注数据**用于模型训练。 3. 我们不建议使用ExpMRC的开发集进行模型训练(尽管并未明令禁止)。您需声明模型是否使用了全部或部分开发集进行训练,此类提交将被标注星号(*)。 ## 引用 若您的研究工作中使用了本基准测试集,请引用以下文献: @article{cui-etal-2022-expmrc, title={ExpMRC: Explainability Evaluation for Machine Reading Comprehension}, author={Cui, Yiming and Liu, Ting and Che, Wanxiang and Chen, Zhigang and Wang, Shijin}, journal={Heliyon}, year={2022}, volume={8}, issue={4}, pages={e09290}, issn={2405-8440}, doi={https://doi.org/10.1016/j.heliyon.2022.e09290} } ## 致谢 [崔一鸣](https://ymcui.com)感谢Google TPU研究云(TRC)项目提供计算资源支持。我们同时感谢[SQuAD团队](https://rajpurkar.github.io/SQuAD-explorer/)开源其网站模板。 ## 联系我们 请通过提交Issue的方式与我们取得联系。

提供机构:
hfl
原始信息汇总

数据集概述

名称: ExpMRC

目的: 用于评估机器阅读理解(MRC)任务的解释性。

包含内容:

  • 四个子集:SQuAD, CMRC 2018, RACE<sup>+</sup>, C<sup>3</sup>
  • 覆盖任务类型:span-extraction 和 multiple-choice questions
  • 支持语言:中文和英文

使用要求:

  • 模型不仅需给出正确答案,还需提供作为证据的文本段落。
  • 鼓励使用无监督或半监督方法,并能在不同语言和类型的MRC任务中泛化。

提交规则:

  1. 可使用任何开源MRC数据或自动生成数据进行训练。
  2. 禁止使用未公开的人工标注数据进行训练。
  3. 不鼓励使用ExpMRC的开发集进行训练,如使用需声明。

引用信息:

@article{cui-etal-2022-expmrc, title={ExpMRC: Explainability Evaluation for Machine Reading Comprehension}, author={Cui, Yiming and Liu, Ting and Che, Wanxiang and Chen, Zhigang and Wang, Shijin}, journal={Heliyon}, year={2022}, volume={8}, issue={4}, pages={e09290}, issn={2405-8440}, doi={https://doi.org/10.1016/j.heliyon.2022.e09290} }

搜集汇总
数据集介绍
hfl/expmrc 数据集图片
构建方式
在机器阅读理解(MRC)领域,尽管预训练语言模型在多项基准上已接近人类水平,但其决策过程的可解释性仍是一个悬而未决的难题。为系统评估和推动这一方向的发展,ExpMRC基准应运而生。该数据集巧妙整合了四个广为人知的MRC子集——SQuAD、CMRC 2018、RACE⁺以及C³,覆盖了英文与中文的跨度抽取与多项选择两类任务。每个子集在原有问答对基础上,额外标注了支撑答案的原文片段作为证据,从而构建起一个专门用于可解释性评测的标准化框架。
使用方法
使用ExpMRC时,研究者可自由利用任何公开的MRC数据或自动生成的数据进行模型训练,但严禁使用未公开的人工标注数据。参赛者需将训练好的模型提交至CodaLab平台,平台将在隐藏的测试集上自动运行并返回评测结果。提交时需明确声明是否使用了ExpMRC的开发集进行训练,若使用,则结果会被标记星号以示区分。这一流程旨在鼓励无监督或半监督的泛化性方法,推动可解释MRC研究的良性竞争。
背景与挑战
背景概述
随着预训练语言模型的迅猛发展,机器阅读理解任务在多个基准数据集上已接近甚至超越人类水平,然而模型内部决策逻辑的不可解释性始终是制约其落地的关键瓶颈。为应对这一挑战,由Yiming Cui、Ting Liu、Wanxiang Che等研究者于2022年提出的ExpMRC基准应运而生,该工作发表于《Heliyon》期刊。ExpMRC旨在系统评估机器阅读理解模型的可解释性,其核心研究问题在于:模型能否在给出正确答案的同时,提供支撑答案的文本证据片段。该基准整合了SQuAD、CMRC 2018、RACE⁺和C³四个子集,覆盖中英文两种语言及跨度抽取与多项选择两类任务,为可解释性研究提供了统一且具有挑战性的评估框架,对推动可信赖自然语言处理系统的发展具有重要影响力。
当前挑战
ExpMRC所面对的挑战首先体现在领域问题的复杂性上:传统机器阅读理解仅关注答案正确性,而可解释性要求模型同时具备证据定位能力,这对模型的理解深度与推理能力提出了更高要求。其次,在基准构建过程中,研究者需对四个来源各异的数据集进行证据标注,如何确保跨语言、跨任务类型的证据标注一致性是一大难题。此外,为维护测试集纯净性,ExpMRC不公开测试数据,仅通过CodaLab平台提交模型进行远程评估,这增加了参与者的技术门槛与协作成本。最后,基准鼓励无监督或半监督方法,但缺乏标注证据的模型在此类设定下往往难以泛化,进一步加剧了评估挑战。
常用场景
经典使用场景
在机器阅读理解领域,随着预训练语言模型的蓬勃发展,模型在多项标准基准上已逼近人类表现,然而其决策过程的可解释性始终是悬而未决的难题。ExpMRC基准应运而生,它融合了SQuAD、CMRC 2018、RACE⁺与C³四个经典数据集的子集,并额外标注了证据文本,覆盖了英文与中文的跨度抽取与多项选择两类任务。该数据集的经典使用场景在于评估模型能否在给出正确答案的同时,从原文中精准定位并输出支撑答案的段落证据,从而衡量模型的解释能力。
解决学术问题
ExpMRC的提出旨在解决机器阅读理解模型“黑箱”特性带来的信任危机,即模型虽能输出正确结果,但其推理过程缺乏透明度。该基准通过引入证据标注,将研究焦点从单纯的答案预测转向解释性评估,促使学术界思考如何让模型不仅“知其然”,更“知其所以然”。其意义在于为可解释自然语言处理提供了标准化的量化评估框架,推动研究者探索无监督或半监督方法,以提升模型在不同语言与任务类型上的泛化解释能力。
实际应用
在实际应用中,ExpMRC所倡导的可解释性对于高风险决策场景尤为关键,例如智能客服系统、法律文书审阅、医疗病历分析以及教育辅导平台。当模型给出答案时,若能同步提供可追溯的证据段落,将显著增强用户对系统的信任,并便于人工复核错误。此外,该基准也可用于开发辅助阅读工具,帮助用户快速定位信息源头,提升信息检索与知识获取的效率。
数据集最近研究
最新研究方向
在机器阅读理解领域,随着预训练语言模型在多项基准上接近甚至超越人类表现,模型的可解释性成为制约其落地应用的关键瓶颈。ExpMRC基准应运而生,通过整合SQuAD、CMRC 2018、RACE⁺和C³四个涵盖抽取式与多项选择任务的英中数据集,并额外标注证据文本,推动模型从“只给答案”向“给出推理依据”的范式转变。当前前沿研究聚焦于无监督或半监督方法下的跨语言、跨任务泛化能力,强调在不依赖额外标注数据的前提下,让模型自主定位支撑答案的关键段落。这一方向不仅呼应了可解释人工智能的热潮,也为构建更透明、可信的问答系统提供了评估标尺,对金融、医疗等高风险领域的AI部署具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务