遇见数据集

zzzzhhh/test_data

收藏
Hugging Face2024-01-29 更新2024-03-04 收录
官方服务:

资源简介:

SuperGLUE是一个新的基准测试,模仿GLUE,包含一组更困难的语言理解任务,改进了资源,并有一个新的公共排行榜。BoolQ(布尔问题,Clark等人,2019a)是一个问答任务,每个例子由一个简短的段落和一个关于段落的yes/no问题组成。问题是由Google搜索引擎用户匿名且未经请求提供的,随后与包含答案的维基百科文章段落配对。我们按照原始工作,使用准确性进行评估。

SuperGLUE是一个新的基准测试,模仿GLUE,包含一组更困难的语言理解任务,改进了资源,并有一个新的公共排行榜。BoolQ(布尔问题,Clark等人,2019a)是一个问答任务,每个例子由一个简短的段落和一个关于段落的yes/no问题组成。问题是由Google搜索引擎用户匿名且未经请求提供的,随后与包含答案的维基百科文章段落配对。我们按照原始工作,使用准确性进行评估。

提供机构:
zzzzhhh
原始信息汇总

数据集概述

基本信息

  • 名称: SuperGLUE
  • 语言: 英语(en)
  • 许可证: 未知
  • 多语言性: 单语
  • 大小: 10K<n<100K
  • 来源: 扩展自其他数据集
  • 任务类别: 文本分类、令牌分类、问答
  • 任务ID: 自然语言推理、词义消歧、共指消解、抽取式问答
  • 标签: superglue, NLU, 自然语言理解

数据集配置

  1. boolq

    • 特征:
      • question: 字符串
      • passage: 字符串
      • idx: 整数32位
      • label: 分类标签(0: False, 1: True)
    • 分割:
      • 训练: 9427个样本
      • 验证: 3270个样本
      • 测试: 3245个样本
    • 数据集大小: 10405708字节
  2. cb

    • 特征:
      • premise: 字符串
      • hypothesis: 字符串
      • idx: 整数32位
      • label: 分类标签(0: entailment, 1: contradiction, 2: neutral)
    • 分割:
      • 训练: 250个样本
      • 验证: 56个样本
      • 测试: 250个样本
    • 数据集大小: 202772字节
  3. copa

    • 特征:
      • premise: 字符串
      • choice1: 字符串
      • choice2: 字符串
      • question: 字符串
      • idx: 整数32位
      • label: 分类标签(0: choice1, 1: choice2)
    • 分割:
      • 训练: 400个样本
      • 验证: 100个样本
      • 测试: 500个样本
    • 数据集大小: 122488字节
  4. multirc

    • 特征:
      • paragraph: 字符串
      • question: 字符串
      • answer: 字符串
      • idx: 结构化(paragraph, question, answer均为整数32位)
      • label: 分类标签(0: False, 1: True)
    • 分割:
      • 训练: 27243个样本
      • 验证: 4848个样本
      • 测试: 9693个样本
    • 数据集大小: 68968948字节
  5. record

    • 特征:
      • passage: 字符串
      • query: 字符串
      • entities: 字符串序列
      • entity_spans: 结构化(text: 字符串, start: 整数32位, end: 整数32位)
      • answers: 字符串序列
      • idx: 结构化(passage, query均为整数32位)
    • 分割:
      • 训练: 100730个样本
      • 验证: 10000个样本
      • 测试: 10000个样本
    • 数据集大小: 213911711字节
  6. rte

    • 特征:
      • premise: 字符串
      • hypothesis: 字符串
      • idx: 整数32位
      • label: 分类标签(0: entailment, 1: not_entailment)
    • 分割:
      • 训练: 2490个样本
      • 验证: 277个样本
      • 测试: 3000个样本
    • 数据集大小: 1915443字节
  7. wic

    • 特征:
      • word: 字符串
      • sentence1: 字符串
      • sentence2: 字符串
      • start1: 整数32位
      • start2: 整数32位
      • end1: 整数32位
      • end2: 整数32位
      • idx: 整数32位
      • label: 分类标签(0: False, 1: True)
    • 分割:
      • 训练: 5428个样本
      • 验证: 638个样本
      • 测试: 1400个样本
    • 数据集大小: 928399字节
  8. wsc

    • 特征:
      • text: 字符串
      • span1_index: 整数32位
      • span2_index: 整数32位
      • span1_text: 字符串
      • span2_text: 字符串
      • idx: 整数32位
      • label: 分类标签(0: False, 1: True)
    • 分割:
      • 训练: 554个样本
      • 验证: 104个样本
      • 测试: 146个样本
    • 数据集大小: 143092字节
  9. wsc.fixed

    • 特征:
      • text: 字符串
      • span1_index: 整数32位
      • span2_index: 整数32位
      • span1_text: 字符串
      • span2_text: 字符串
      • idx: 整数32位
      • label: 分类标签(0: False, 1: True)
    • 分割:
      • 训练: 554个样本
      • 验证: 104个样本
      • 测试: 146个样本
    • 数据集大小: 143088字节
  10. axb

    • 特征:
      • sentence1: 字符串
      • sentence2: 字符串
      • idx: 整数32位
      • label: 分类标签(0: entailment, 1: not_entailment)
    • 分割:
      • 测试: 1104个样本
    • 数据集大小: 238392字节
  11. axg

    • 特征:
      • premise: 字符串
      • hypothesis: 字符串
      • idx: 整数32位
      • label: 分类标签(0: entailment, 1: not_entailment)
    • 分割:
      • 测试: 356个样本
    • 数据集大小: 53581字节
搜集汇总
数据集介绍
zzzzhhh/test_data 数据集图片
构建方式
在自然语言处理领域,SuperGLUE作为GLUE的进阶基准,旨在评估模型在更具挑战性的语言理解任务上的表现。该数据集汇聚了来自多个子任务的样本,包括BoolQ(布尔问答)、CB(蕴含关系判别)、COPA(因果推理)、MultiRC(多项选择阅读理解)、ReCoRD(完形填空式推理)、RTE(文本蕴含识别)、WiC(词义消歧)以及WSC(指代消解)。每个子任务均源自现有高质量数据集,并由专家进行标注,确保标签的准确性与一致性。数据划分遵循标准训练、验证与测试集结构,其中BoolQ包含约1.3万样本,ReCoRD拥有超12万样本,整体规模介于1万至10万之间,为模型训练与评估提供了丰富资源。
特点
SuperGLUE的核心特点在于其多任务集成设计与高难度基准定位。它覆盖了文本分类、序列标注与问答三类核心任务,具体涉及自然语言推理、词义消歧、指代消解及抽取式问答等细粒度挑战。每个子任务的数据字段经过精心设计,如BoolQ包含问题、段落与二元标签,WiC记录词语在双句中的位置索引,WSC则标注文本中的指代跨度。数据集的单语性(英语)与专家生成标注保障了语言质量,而丰富的划分(训练、验证、测试)支持了模型的全面评估。此外,其开源许可与HuggingFace集成使得数据加载便捷,适配多类预训练语言模型的微调需求。
使用方法
借助HuggingFace的datasets库,SuperGLUE可通过简单API调用高效加载。用户需指定子任务配置名(如'boolq'、'cb')以获取对应数据,每个配置均以字典形式返回特征与标签。例如,加载BoolQ训练集时,可调用load_dataset('super_glue', 'boolq', split='train'),得到包含question、passage与label字段的样本。对于序列标注任务如WSC,需解析span1_index与span2_index字段以提取指代关系。模型训练时,建议根据子任务选择相应损失函数(如二分类交叉熵用于BoolQ,三分类用于CB),并利用验证集调整超参数。测试集可用于最终性能评估,支持提交至官方排行榜进行对比。
背景与挑战
背景概述
SuperGLUE是一个由纽约大学、华盛顿大学等多所顶尖机构的研究者于2019年共同推出的自然语言理解基准测试集,旨在克服其前身GLUE基准的局限性。该数据集的核心研究问题在于评估通用语言理解系统在更为复杂和多样化的任务上的表现,涵盖问答、自然语言推理、词义消歧、指代消解等八个子任务。通过整合BoolQ、CB、COPA、MultiRC、ReCoRD、RTE、WiC和WSC等挑战性数据集,SuperGLUE为研究者提供了一个更为严苛的模型评估平台,显著推动了自然语言处理领域的发展,成为衡量模型语言理解能力的重要标杆。
当前挑战
SuperGLUE所解决的领域挑战在于传统基准测试如GLUE已无法有效区分先进模型的性能差异,亟需更困难的任务来推动技术进步。该数据集中的任务涉及深层语义理解、常识推理和多步推理,对模型的语言理解能力提出了极高要求。在构建过程中,研究者面临了多重挑战:如何从真实用户查询中筛选并标注高质量数据(如BoolQ中的是非问题),如何确保各子任务的数据规模和难度平衡,以及如何设计公平且可复现的评估协议。此外,数据集的标注工作依赖专家知识,成本高昂且耗时,同时需谨慎处理可能存在的偏见和敏感信息。
常用场景
经典使用场景
SuperGLUE数据集作为自然语言理解领域的标杆性基准,其经典使用场景在于对预训练语言模型的综合能力进行多维度评估。该数据集涵盖BoolQ、CB、COPA、MultiRC、ReCoRD、RTE、WiC、WSC等八项子任务,分别对应二值问答、蕴含关系判别、因果推理、多选阅读理解、代词消解、文本蕴含、词义消歧及指代消解等核心语义理解挑战。研究者常将模型在SuperGLUE上的整体表现作为衡量其语言理解泛化能力的关键指标,通过对比各子任务的得分来诊断模型在特定认知维度上的优劣。这种多任务联合评估范式不仅揭示了模型在复杂语言现象上的鲁棒性,更为后续模型架构创新提供了清晰的性能参照系。
实际应用
在实际应用场景中,SuperGLUE所涵盖的任务类型直接映射至众多商业智能系统的核心需求。基于BoolQ任务训练的模型可赋能搜索引擎的精准问答功能,帮助用户从海量文档中快速获取是非判断;RTE与CB任务的解决方案被广泛应用于智能客服系统中的用户意图识别与矛盾检测,确保对话逻辑的一致性;而WSC与WiC任务的技术成果则深度嵌入文本编辑软件的指代修正与词义消歧模块,显著提升语义理解的精确度。此外,MultiRC与ReCoRD任务所代表的复杂阅读理解能力,在金融领域的合同条款解析、医疗领域的病历信息抽取以及法律领域的判例检索系统中发挥着不可替代的作用,为这些高价值场景提供了可靠的技术支撑。
衍生相关工作
SuperGLUE数据集催生了一系列里程碑式的学术工作,其中最具代表性的包括探索预训练语言模型在困难任务上表现的深入分析研究,以及针对特定子任务设计的专用模型架构。例如,基于BoolQ任务的挑战性,研究者开发了融合外部知识图谱的推理增强模型,显著提升了二值问答的准确率;针对COPA任务中因果推理的独特性,涌现出利用反事实数据增强与结构化因果图引导的解决方案。在模型评估方法论层面,SuperGLUE推动了细粒度性能诊断工具的发展,如通过各子任务的错误分析揭示模型在否定结构、量化表达与常识推理上的系统性缺陷。这些衍生工作不仅深化了对语言理解本质的认知,还促进了跨任务迁移学习与多任务联合训练范式的成熟,为构建更通用的语言智能系统奠定了坚实的实验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务