FarSick
收藏资源简介:
FarSick是第一个相对大规模的波斯语语义文本相似性和自然语言推理数据集,包含约10,000对英文句子。每对句子都标注了相关性和语义含义,以及两个元素之间的蕴涵关系。该数据集是通过翻译和编辑SICK数据集的句子收集的。
FarSick represents the inaugural relatively large-scale Persian dataset for semantic textual similarity and natural language inference, encompassing approximately 10,000 pairs of English sentences. Each sentence pair is annotated with relevance and semantic meaning, along with the entailment relationship between the two elements. This dataset was compiled through the translation and editing of sentences from the SICK dataset.
数据集概述
数据集名称
FarSick: A Persian Semantic Textual Similarity And Natural Language Inference Dataset
数据集描述
FarSick是首个针对波斯语的相对大规模的语义文本相似性和自然语言推理数据集。该数据集包含约10,000对英文句子,每对句子都进行了相关性和语义意义的标注,以及两个元素之间的蕴涵关系。
数据集来源
数据集是通过翻译和编辑SICK数据集的句子收集而成。
文件结构
- 格式:制表符分隔的文本文件
字段信息
- pair_ID: 句子对ID
- sentence_A: 句子A
- sentence_B: 句子B
- entailment_label: 文本蕴涵金标(NEUTRAL, ENTAILMENT, 或 CONTRADICTION)
- relatedness_score: 语义相关性金分(1-5连续尺度)
- entailment_AB: A-B顺序的蕴涵(A_neutral_B, A_entails_B, 或 A_contradicts_B)
- entailment_BA: B-A顺序的蕴涵(B_neutral_A, B_entails_A, 或 B_contradicts_A)
- sentence_A_dataset: 原始句子A提取的数据集(FLICKR vs. SEMEVAL)
- sentence_B_dataset: 原始句子B提取的数据集(FLICKR vs. SEMEVAL)
- SemEval_set: SemEval 2014 Task 1中的句子对集合(TRIAL, TRAIN, 或 TEST)
- binary_label: 语义金分(0 vs. 1)
统计信息
-
训练对: 4439
-
试验对: 495
-
测试对: 4906
-
总对数: 9840
-
训练标签: {entailment: 1274, neutral: 2524, contradiction: 641}, {0: 1065, 1: 3374}
-
试验标签: {entailment: 143, neutral: 281, contradiction: 71}, {0: 105, 1: 390}
-
测试标签: {entailment: 1404, neutral: 2790, contradiction: 712}, {0: 1126, 1: 3780}
-
训练令牌数: 3384
-
试验令牌数: 1264
-
测试令牌数: 3360




