遇见数据集

SQuAD v2.0 斯坦福问答数据集

收藏
官方服务:

资源简介:

原始数据SQuAD v2.0(Stanford Question Answering Dataset v2.0)是斯坦福大学发布的大规模机器阅读理解与问答数据集,主要用于评估模型在阅读理解、信息抽取以及不可回答问题识别等任务中的能力。该数据集是在SQuAD v1.1的基础上扩展形成的。与早期版本相比,SQuAD v2.0在保留原有可回答问题的同时,新增了大量不可回答问题,用于提高任务难度并增强模型对真实问答场景的适应能力。数据集中的每条数据主要包括上下文段落、自然语言问题以及对应答案。上下文段落主要来源于Wikipedia英文文章,问题由众包工人根据段落内容人工编写。对于可回答问题,数据集提供准确的答案文本片段以及答案在原文中的起始位置;对于不可回答问题,则通过特殊标记表示该问题在上下文中不存在答案。整个数据集包含超过15万条问答样本,其中包括约10万条可回答问题以及超过5万条不可回答问题。训练集约包含13万条问题,验证集和测试集规模均约为5万条左右。衍生数据为项目基于SQuAD v2.0原始数据进行的数据处理、评估方式、方法结果、衍生结论。

提供机构:
浙江大学
二维码
社区交流群
二维码
科研交流群
商业服务