遇见数据集

x-span-similarity

收藏
Hugging Face2026-07-31 更新2026-08-01 收录
官方服务:

资源简介:

X-Span-Similarity (Cross-Lingual SSD) 是一个跨语言文本跨度相似性数据集,用于评估和训练自然语言处理模型在跨语言场景下的语义理解能力。该数据集包含多个语言区域配置,每个配置包含 premise 和 hypothesis 两个句子,以及对应的跨度相似性得分(整数序列)和句子相似性得分(整数)。此外,每条记录还标注了 premise 和 hypothesis 的语言代码以及区域信息。数据集覆盖 50 多种语言,包括阿拉伯语、保加利亚语、印地语、英语、中文等。每个语言区域配置包含 1600 个训练样本和 400 个测试样本,总共超过 100 个配置。该数据集适用于文本分类(如句子相似性判断)和标记分类(如跨度相似性预测)任务,特别适合跨语言语义相似性分析、机器翻译质量评估和自然语言推理研究。

X-Span-Similarity (Cross-Lingual SSD) is a cross-lingual text span similarity dataset for evaluating and training natural language processing models in cross-lingual semantic understanding. It contains multiple language-region configurations, each with premise and hypothesis sentences, corresponding span similarity scores (integer sequences), and sentence similarity scores (integers). Each record also includes language codes and region information for premise and hypothesis. The dataset covers over 50 languages, including Arabic, Bulgarian, Hindi, English, Chinese, etc. Each language-region configuration has 1600 training samples and 400 test samples, with over 100 configurations in total. It is suitable for text classification (e.g., sentence similarity judgment) and token classification (e.g., span similarity prediction) tasks, particularly for cross-lingual semantic similarity analysis, machine translation quality evaluation, and natural language inference research.

创建时间:
2026-07-30
原始信息汇总

X-Span-Similarity (Cross-Lingual SSD) 数据集概述

基本信息

  • 数据集名称:X-Span-Similarity (Cross-Lingual SSD)
  • 许可证:cc-by-sa-4.0
  • 任务类别:文本分类、词元分类
  • 标签:跨语言、跨度相似性、语义相似性、机器翻译、自然语言推理

语言覆盖

数据集覆盖 56种语言,包括阿拉伯语(埃及、沙特)、保加利亚语、博杰普尔语、孟加拉语、加泰罗尼亚语、捷克语、丹麦语、德语、希腊语、英语、西班牙语(墨西哥)、爱沙尼亚语、波斯语、芬兰语、菲律宾语、法语、古希腊语、古吉拉特语、希伯来语、印地语、克罗地亚语、匈牙利语、印度尼西亚语、冰岛语、意大利语、日语、卡纳达语、韩语、立陶宛语、拉脱维亚语、马赛语、马拉雅拉姆语、马拉地语、挪威语、荷兰语、旁遮普语、波兰语、葡萄牙语、罗马尼亚语、俄语、斯洛伐克语、斯洛文尼亚语、塞尔维亚语(西里尔/拉丁)、瑞典语、斯瓦希里语、泰米尔语、泰卢固语、泰语、土耳其语、乌克兰语、乌尔都语、越南语、中文(简体)、祖鲁语。

数据规模

数据集包含 56 个配置(config),每个配置对应一种语言变体。每个配置包含:

  • 训练集:1,600 个样本
  • 测试集:400 个样本
  • 总样本数:每个配置 2,000 个样例,全数据集合计 112,000 个样例

数据字段

每个样本包含以下特征:

  • premise(字符串):前提文本
  • hypothesis(字符串):假设文本
  • span_similarity(整数序列):跨度相似性标注
  • sentence_similarity(整数):句子级相似性
  • lang_premise(字符串):前提语言代码
  • lang_hypothesis(字符串):假设语言代码
  • locale(字符串):地区/语言环境标识

数据格式

数据文件采用 JSONL 格式存储,每个配置包含独立的训练和测试文件。文件名格式为 ssd_train_{locale}.jsonlssd_test_{locale}.jsonl

搜集汇总
数据集介绍
x-span-similarity 数据集图片
构建方式
X-Span-Similarity(跨语言跨度相似度)数据集,旨在捕捉机器翻译中源句与译句之间的语义对应关系,特别聚焦于跨语言环境下词或短语层面的相似性标注。该数据集覆盖了超过55种语言,每种语言配置包含1600条训练样本与400条测试样本,以JSONL格式存储。每条样本由前提(premise)与假设(hypothesis)两个文本片段组成,并标注了跨度相似性(span_similarity)的整数序列,以及整体句子相似度(sentence_similarity)。构建过程融合了自然语言推理(NLI)与机器翻译(MT)的语料特征,通过人工标注与自动化流程相结合,确保了跨语言语义判断的准确性与一致性。
特点
该数据集的核心特点在于其细粒度的跨语言跨度相似度标注,突破了传统整句相似度评估的局限,提供了词或短语级别的对应关系,为多语言语义分析提供了深度维度。数据覆盖广泛,囊括了包括低资源语言在内的数十种语言对,且按语言区域(locale)细分,如ar_eg、zh_cn等,增强了地域多样性。每条样本同时包含跨度级与句子级相似度标签,支持多粒度任务。此外,标签与语言信息字段(如lang_premise、lang_hypothesis)的配套使得研究能够探索语言对之间的语义关联,为跨语言模型的评估与训练提供了丰富素材。
使用方法
该数据集适用于跨语言语义相似度计算、机器翻译质量评估及多语言自然语言推理等研究。研究者可直接通过HuggingFace datasets库加载特定语言配置,利用其训练集微调跨语言模型,如XLM-R,以提升模型对源句与目标句间跨度级语义映射的感知能力。测试集可用于基准测试,评估模型在跨语言跨度相似度预测上的表现。数据格式简洁,每条包含premise、hypothesis、span_similarity等字段,便于设计序列标注或分类任务。值得注意的是,span_similarity为整数序列,对应假设中每个词或子词的相似度标签,因而也支持序列标注模型的训练与评估,为多语言细粒度语义理解提供了实用工具。
背景与挑战
背景概述
X-Span-Similarity(跨语言跨度相似性)数据集于近期由多语言自然语言处理领域的研究者构建,旨在推进跨语言语义相似性判断的研究。该数据集覆盖了超过一百种语言变体,为每个语言对提供了结构化的训练与测试样本,其核心研究问题聚焦于跨语言环境中语义等价性的细粒度评估,特别是在片段级(span-level)的相似性判断上。通过引入span_similarity和sentence_similarity等多维度标注,该数据集不仅促进了机器翻译与自然语言推理的交叉研究,还为难例挖掘和模型鲁棒性评估提供了宝贵资源,对多语言预训练模型的性能提升和跨语言理解能力的增强具有显著影响力。
当前挑战
该数据集面临的挑战多维且严峻。在领域问题层面,跨语言语义相似性判断本身极具难度,不同语言间的句法结构、文化内涵和表达习惯差异导致模型难以精确对齐语义单元,尤其对于低资源语言(如mas、zu等)更是如此,这要求模型具备强大的跨语言泛化能力。在构建过程中,研究者需克服多语言数据收集与标注一致性的难题,确保各语言对的标注标准统一,避免因翻译或注释歧义引入噪声;同时,如何平衡数据量分布以覆盖广泛语言变体,并设计合理的跨度切分策略以准确反映片段级相似性,也是构建该数据集时的重大挑战。
常用场景
经典使用场景
X-Span-Similarity数据集,作为跨语言跨度相似性(Cross-Lingual SSD)的基准,其核心使用场景聚焦于细粒度语义相似性判断。该数据集以跨语言的自然语言推理(NLI)任务为基石,通过提供多语言对(如阿拉伯语-英语、汉语-英语等)的句子对及对应的跨度级相似性标注,为研究者构建和评估跨语言语义模型提供了高精度的测试平台。经典的用法包括基于跨度相似性得分进行句子对齐、机器翻译质量评估以及跨语言信息检索中的语义匹配,尤其适用于那些需要对文本片段进行精细语义区分的任务。
实际应用
在实际应用层面,X-Span-Similarity数据集的标注结构直接服务于多语言机器翻译的译文质量评估,允许开发者精准定位译文中的错误片段,从而优化翻译模型。同时,该数据集可应用于跨语言搜索引擎中的查询-文档匹配,通过跨度相似性得分改善检索结果的语义相关性。在跨语言问答系统中,该数据能助力模型识别答案片段在源语言和目标语言中的对应关系,提升信息抽取的准确性。此外,该数据集还适用于多语言内容审核场景,辅助识别不同语言中语义等效但不安全的内容,增强全球化平台的合规性。
衍生相关工作
基于X-Span-Similarity数据集,衍生出了多项具有影响力的研究工作。在多语言预训练模型评估方面,研究者利用该数据集设计跨语言诊断任务,系统性地测试了mBERT、XLM-R等模型的跨度级语义理解能力,揭示不同语言对的性能差异。在知识蒸馏领域,该数据集被用作跨语言教师-学生框架的训练资源,通过传递跨度相似性知识来压缩模型。此外,该数据集催生了一系列跨语言细粒度语义匹配模型的提出,如基于注意力机制的跨语言对齐模型,以及利用跨度相似性信号改进的对比学习架构,这些工作共同推动了跨语言自然语言处理技术的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务