x-span-similarity
收藏资源简介:
X-Span-Similarity (Cross-Lingual SSD) 是一个跨语言文本跨度相似性数据集,用于评估和训练自然语言处理模型在跨语言场景下的语义理解能力。该数据集包含多个语言区域配置,每个配置包含 premise 和 hypothesis 两个句子,以及对应的跨度相似性得分(整数序列)和句子相似性得分(整数)。此外,每条记录还标注了 premise 和 hypothesis 的语言代码以及区域信息。数据集覆盖 50 多种语言,包括阿拉伯语、保加利亚语、印地语、英语、中文等。每个语言区域配置包含 1600 个训练样本和 400 个测试样本,总共超过 100 个配置。该数据集适用于文本分类(如句子相似性判断)和标记分类(如跨度相似性预测)任务,特别适合跨语言语义相似性分析、机器翻译质量评估和自然语言推理研究。
X-Span-Similarity (Cross-Lingual SSD) is a cross-lingual text span similarity dataset for evaluating and training natural language processing models in cross-lingual semantic understanding. It contains multiple language-region configurations, each with premise and hypothesis sentences, corresponding span similarity scores (integer sequences), and sentence similarity scores (integers). Each record also includes language codes and region information for premise and hypothesis. The dataset covers over 50 languages, including Arabic, Bulgarian, Hindi, English, Chinese, etc. Each language-region configuration has 1600 training samples and 400 test samples, with over 100 configurations in total. It is suitable for text classification (e.g., sentence similarity judgment) and token classification (e.g., span similarity prediction) tasks, particularly for cross-lingual semantic similarity analysis, machine translation quality evaluation, and natural language inference research.
X-Span-Similarity (Cross-Lingual SSD) 数据集概述
基本信息
- 数据集名称:X-Span-Similarity (Cross-Lingual SSD)
- 许可证:cc-by-sa-4.0
- 任务类别:文本分类、词元分类
- 标签:跨语言、跨度相似性、语义相似性、机器翻译、自然语言推理
语言覆盖
数据集覆盖 56种语言,包括阿拉伯语(埃及、沙特)、保加利亚语、博杰普尔语、孟加拉语、加泰罗尼亚语、捷克语、丹麦语、德语、希腊语、英语、西班牙语(墨西哥)、爱沙尼亚语、波斯语、芬兰语、菲律宾语、法语、古希腊语、古吉拉特语、希伯来语、印地语、克罗地亚语、匈牙利语、印度尼西亚语、冰岛语、意大利语、日语、卡纳达语、韩语、立陶宛语、拉脱维亚语、马赛语、马拉雅拉姆语、马拉地语、挪威语、荷兰语、旁遮普语、波兰语、葡萄牙语、罗马尼亚语、俄语、斯洛伐克语、斯洛文尼亚语、塞尔维亚语(西里尔/拉丁)、瑞典语、斯瓦希里语、泰米尔语、泰卢固语、泰语、土耳其语、乌克兰语、乌尔都语、越南语、中文(简体)、祖鲁语。
数据规模
数据集包含 56 个配置(config),每个配置对应一种语言变体。每个配置包含:
- 训练集:1,600 个样本
- 测试集:400 个样本
- 总样本数:每个配置 2,000 个样例,全数据集合计 112,000 个样例
数据字段
每个样本包含以下特征:
- premise(字符串):前提文本
- hypothesis(字符串):假设文本
- span_similarity(整数序列):跨度相似性标注
- sentence_similarity(整数):句子级相似性
- lang_premise(字符串):前提语言代码
- lang_hypothesis(字符串):假设语言代码
- locale(字符串):地区/语言环境标识
数据格式
数据文件采用 JSONL 格式存储,每个配置包含独立的训练和测试文件。文件名格式为 ssd_train_{locale}.jsonl 和 ssd_test_{locale}.jsonl。




