遇见数据集

hfl/cmrc2019

收藏
Hugging Face2024-05-28 更新2024-06-12 收录
官方服务:

资源简介:

CMRC 2019数据集是用于中文机器阅读理解任务的公开数据集,包含多个子集,如训练数据、开发数据和测试数据。该数据集旨在通过句子填空任务来评估模型的阅读理解能力。数据集由多个部分组成,包括试验数据、训练数据、开发数据、资格数据和测试数据,每个部分都有不同的段落数量和查询数量。数据集还提供了基于BERT的基线系统,并支持通过CodaLab平台提交模型进行测试。

CMRC 2019数据集是用于中文机器阅读理解任务的公开数据集,包含多个子集,如训练数据、开发数据和测试数据。该数据集旨在通过句子填空任务来评估模型的阅读理解能力。数据集由多个部分组成,包括试验数据、训练数据、开发数据、资格数据和测试数据,每个部分都有不同的段落数量和查询数量。数据集还提供了基于BERT的基线系统,并支持通过CodaLab平台提交模型进行测试。

提供机构:
hfl
原始信息汇总

数据集概述

标题: A Sentence Cloze Dataset for Chinese Machine Reading Comprehension
作者: Yiming Cui, Ting Liu, Ziqing Yang, Zhipeng Chen, Wentao Ma, Wanxiang Che, Shijin Wang, Guoping Hu
发表会议: COLING 2020
论文链接: https://arxiv.org/abs/2004.03116

数据集详情

  • 许可: cc-by-sa-4.0
  • 语言: 中文, 英文
  • 数据集组成:
    • Trial Data: 139 passages, 1,504 queries, QAC 71.941%, PAC 28.776%, No Fake Candidates, Public
    • Train Data: 9,638 passages, 100,009 queries, QAC N/A, PAC N/A, No Fake Candidates, Public
    • Development Data: 300 passages, 3,053 queries, QAC 70.586%, PAC 13.333%, Yes Fake Candidates, Public
    • Qualifying Data: 500 passages, 5,081 queries, QAC 70.01%, PAC 8.20%, Yes Fake Candidates, Semi-Hidden
    • Test Data: -, -, -, -, Yes Fake Candidates, Hidden

提交指南

基准系统

  • 提供基于BERT的基准系统,详情请查看baseline目录。

引用信息

  • 如需在研究中使用本数据集,请引用以下论文:

@inproceeding{cui-etal-2020-cmrc2019, title={A Sentence Cloze Dataset for Chinese Machine Reading Comprehension}, author={Cui, Yiming and Liu, Ting and Yang, Ziqing and Chen, Zhipeng and Ma, Wentao and Che, Wanxiang and Wang, Shijin and Hu, Guoping}, booktitle = "Proceedings of the 28th International Conference on Computational Linguistics (COLING 2020)", year={2020} }

国际标准语言资源编号 (ISLRN)

搜集汇总
数据集介绍
hfl/cmrc2019 数据集图片
构建方式
CMRC 2019数据集由哈尔滨工业大学与科大讯飞联合实验室构建,旨在推动中文机器阅读理解中的句子完形填空任务。该数据集基于大规模中文篇章,通过人工设计查询问题并选取候选句子构建而成。训练集包含9,638个篇章和100,009个查询,开发集与资格赛集则引入了干扰候选句以增加难度。数据集的标注过程严格遵循标准化流程,确保每个查询对应一个正确答案,从而为模型提供明确的监督信号。整个构建过程兼顾了真实场景的复杂性与评估的公平性,最终公开的数据集版本采用CC-BY-SA-4.0许可协议。
使用方法
使用CMRC 2019数据集时,研究者可基于公开的训练集和开发集进行模型训练与调优。数据集以标准格式提供篇章、查询及候选句子列表,用户需构建模型预测每个查询对应的正确句子。官方提供了基于BERT的基线系统,便于快速上手。对于希望评估模型泛化能力的团队,可通过CodaLab平台提交模型至隐藏测试集和挑战集进行测评。数据集的使用需遵循CC-BY-SA-4.0许可,并在相关研究中引用原始论文以尊重作者贡献。
背景与挑战
背景概述
在自然语言处理领域,机器阅读理解(MRC)一直是衡量模型语言理解能力的重要基准。2019年,由哈尔滨工业大学与科大讯飞联合实验室(HFL)主导,崔一鸣、刘挺等研究者共同推出了CMRC 2019数据集,并发表于COLING 2020会议。该数据集聚焦于中文句子完形填空任务,要求模型从给定段落中精准选择缺失的句子,从而填补了当时中文阅读理解在篇章级语义推理方面的空白。其创建旨在推动模型对中文长文本的深层理解,特别是跨句逻辑关系的捕捉,为后续研究提供了标准化的评估平台,对中文NLP领域产生了深远影响。
当前挑战
CMRC 2019面临的挑战主要来自两方面。其一,句子完形填空任务本身要求模型具备精细的篇章理解能力,需在多个候选句子中甄别最符合上下文逻辑的选项,这比传统的片段抽取或多项选择更具难度,尤其当引入虚假候选句(Fake Candidates)时,模型易受干扰。其二,数据构建过程中,为确保任务真实性和难度,研究者精心设计了涵盖训练、开发、资格赛及隐藏测试的多层次数据集,并引入半隐藏与完全隐藏的评估机制,这给数据标注、质量控制和公平评测带来了技术与管理上的双重挑战。
常用场景
经典使用场景
CMRC 2019(Sentence Cloze Dataset for Chinese Machine Reading Comprehension)是一个面向中文机器阅读理解的任务型数据集,其核心场景为句子填空式阅读理解。模型需在给定上下文段落与问题的基础上,从多个候选句子中精准选择最恰当的填入空白处,从而验证其对篇章语义与逻辑连贯性的深层理解。该任务不同于传统的抽取式或生成式阅读理解,更强调全局语境推理与句子级语义匹配能力,成为评测中文自然语言理解系统在复杂推理场景下表现的重要基准。
解决学术问题
该数据集有效填补了中文机器阅读理解领域中句子填空任务的空白,解决了传统阅读理解任务仅关注片段抽取而忽视整体语义连贯性评估的局限。学术研究上,它推动了模型对篇章级上下文理解、跨句子推理以及干扰项辨别能力的提升,为评估语言模型在中文环境下的深层语义建模提供了标准化平台。其公开的挑战赛排行榜持续激励研究者探索更优的神经网络架构,促进了预训练语言模型在中文复杂推理任务中的性能突破。
实际应用
在实际应用中,CMRC 2019所代表的句子填空能力可广泛应用于智能教育领域的自动阅读理解评估、辅助写作系统中的上下文衔接检测,以及智能问答系统中的精准信息检索与补全。例如,在中文教材的自动出题与评分系统中,模型需根据文章内容生成或选择合适句子填入空缺,从而检验学生对文本逻辑的掌握程度。此外,该技术也可服务于法律、医疗等专业文档的语义校验与信息抽取场景,提升自动化处理文本的准确性与可靠性。
数据集最近研究
最新研究方向
在中文机器阅读理解领域,CMRC 2019数据集作为一项开创性的句子完形填空任务,正引领着前沿研究方向。该数据集通过设计包含虚假候选答案的挑战性样本,推动了模型在深层语义理解与推理能力上的突破。近年来,随着预训练语言模型(如BERT、RoBERTa等)的广泛应用,研究者们聚焦于提升模型在噪声干扰下的鲁棒性,以及跨段落、跨文档的复杂推理能力。CMRC 2019在COLING 2020上发布后,其公开排行榜持续吸引全球团队参与,成为评估中文NLP系统综合性能的重要基准。该数据集不仅促进了中文阅读理解技术的进步,还推动了相关应用如智能问答、对话系统的发展,对提升中文信息处理水平具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务