遇见数据集

tasksource/parade

收藏
Hugging Face2023-05-31 更新2024-03-04 收录
官方服务:

资源简介:

PARADE是一个新的基准数据集,用于需要计算机科学领域知识的同义句识别。该数据集包含在词汇和句法层面重叠很少但在语义上等价的句子对,以及在词汇和句法层面重叠很大但在语义上不等价的句子对。实验表明,现有的神经模型和非专家人类注释者在PARADE上的表现都很差。

PARADE是一个新的基准数据集,用于需要计算机科学领域知识的同义句识别。该数据集包含在词汇和句法层面重叠很少但在语义上等价的句子对,以及在词汇和句法层面重叠很大但在语义上不等价的句子对。实验表明,现有的神经模型和非专家人类注释者在PARADE上的表现都很差。

提供机构:
tasksource
原始信息汇总

数据集概述

数据集名称

  • PARADE

任务类别

  • 句子相似度
  • 文本分类

语言

  • 英语

出版信息

  • 标题: PARADE: A New Dataset for Paraphrase Identification Requiring Computer Science Domain Knowledge
  • 作者: He, Yun et al.
  • 会议: 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP)
  • 出版日期: November 2020
  • 出版商: Association for Computational Linguistics
  • 论文页码: 7572--7582

数据集特点

  • 包含基于计算机科学领域知识的语义等价但词汇和句法重叠很少的同义句,以及词汇和句法重叠很大但基于该领域知识语义不等价的非同义句。
  • 实验显示,即使是BERT等先进神经模型在此数据集上的表现也相对较低,F1分数为0.709。

可用性

  • 数据和代码已公开。
二维码
社区交流群
二维码
科研交流群
商业服务