遇见数据集

sts

收藏
Hugging Face2026-08-29 更新2026-08-30 收录
官方服务:

资源简介:

Luganda STS Benchmark 是原始语义文本相似度(STS)基准的卢干达语改编版本,旨在评估语言模型对卢干达语句子对之间语义相似性的理解能力。该数据集通过手工改编原始STS基准的测试集构建,当前版本包含约169个卢干达语句子对,均来自原始STS基准的测试分割。开发集(dev)正在扩展中,训练集(train)尚未包含。每个样本包含两个卢干达语句子,模型需要判断它们在语义上的相似程度。该基准强调语义理解而非词汇或句法匹配,两个句子可能使用不同的词汇或语法结构但表达相同含义,也可能共享相似词汇但表达不同含义。该数据集可用于评估卢干达语句子嵌入模型、语义相似度模型、跨语言表示模型、信息检索系统、多语言语言模型、自然语言理解系统以及卢干达语特定语言模型。改编过程注重保留句子对之间的语义关系,而非逐字翻译,因此可能会在措辞、语法结构或词汇选择上进行调整。当前版本规模较小,应视为早期开发版本,评估结果需结合基准大小进行解读。未来版本将提供更广泛的语义关系和语言变体覆盖。

The Luganda STS Benchmark is an adaptation of the original Semantic Textual Similarity (STS) benchmark into Luganda, designed to evaluate the ability of language models to understand semantic similarity between sentence pairs in Luganda. The dataset is constructed by manually adapting the test set of the original STS benchmark, currently containing approximately 169 Luganda sentence pairs, all from the test split of the original STS benchmark. The development set (dev) is being expanded, and the training set (train) is not yet included. Each sample consists of two Luganda sentences, and the model needs to judge their semantic similarity. This benchmark emphasizes semantic understanding rather than lexical or syntactic matching; two sentences may use different vocabulary or grammar structures but express the same meaning, or share similar vocabulary but express different meanings. The dataset can be used to evaluate Luganda sentence embedding models, semantic similarity models, cross-lingual representation models, information retrieval systems, multilingual language models, natural language understanding systems, and Luganda-specific language models. The adaptation process focuses on preserving the semantic relationships between sentence pairs rather than word-for-word translation, so adjustments may be made in wording, grammatical structure, or vocabulary choice. The current version is small in scale and should be considered an early development version; evaluation results should be interpreted in the context of the benchmark size. Future versions will provide broader coverage of semantic relationships and language variants.

创建时间:
2026-08-23
原始信息汇总

Luganda STS Benchmark 数据集概述

基本信息

  • 许可证:Apache-2.0
  • 任务类别:句子相似度(sentence-similarity)
  • 语言:Luganda(卢干达语)
  • 数据集规模:少于1,000个样本(n<1K)

数据集简介

该数据集是语义文本相似度(STS)基准的Luganda语改编版本,旨在评估语言模型在理解Luganda语句对之间语义相似性方面的能力。数据集源自原始的STS Benchmark,并正在人工改编和扩充中,其目标是评估语义理解能力,而非简单的词汇或句法匹配。

当前状态

  • 初始版本:包含约200对来自原始STS Benchmark测试集的句子对
  • 开发状态:数据集正在积极扩充中,后续将增加更多测试集样本,并逐步扩充开发集
数据划分 当前状态
测试集 初始Luganda改编版本,约200个样本(README后文提及约130个样本)
开发集 待扩充
训练集 暂未包含

任务说明

每个样本包含一对Luganda语句,模型需要判断这两个句子在语义上传达相同含义的程度。该基准旨在测试语义理解能力,而非简单的词汇重叠——两个句子可能使用不同的词汇或语法结构却表达实质上相同的语义,而词汇相似的句子也可能表达不同的含义。

预期用途

该基准可用于评估以下模型或系统:

  • Luganda语句嵌入模型
  • 语义相似度模型
  • 跨语言表示模型
  • 信息检索系统
  • 多语言语言模型
  • 自然语言理解系统
  • Luganda专用语言模型

此外,它也可用于评估Luganda语言建模的改进是否能带来更好的语义表征。

数据集开发方法

当前测试集是基准的初始发布版本,后续将从原始STS Benchmark中逐步改编并扩充更多样本。改编的重点是保留语句对之间的语义关系,而非逐字翻译。因此,忠实的语义改编可能需要在Luganda语中改变措辞、语法结构或词汇选择。

局限性

  • 当前发布版本规模较小,应视为早期开发版本,而非完整的Luganda STS基准
  • 测试集目前包含约130个样本,开发集仍在扩展中
  • 在此版本上的评估结果应结合基准规模进行解读
  • 未来版本预计将提供更广泛的语义关系和Luganda语言变异覆盖

归属与引用

该数据集是STS Benchmark的Luganda改编版本,原始基准源自SemEval-2017 Task 1: Semantic Textual Similarity Multilingual and Crosslingual Focused Evaluation

原始STS Benchmark引用

Cer, D., Diab, M., Agirre, E., Lopez-Gazpio, I., & Specia, L. (2017). SemEval-2017 Task 1: Semantic Textual Similarity Multilingual and Crosslingual Focused Evaluation. Proceedings of the 11th International Workshop on Semantic Evaluation (SemEval-2017), 1–14.

Luganda改编版本引用

Matovu Caleb (2026). Luganda STS Benchmark. SAGE POND. Luganda adaptation and expansion of the STS Benchmark.

致谢

该基准建立在STS Benchmark及相关研究者对原始语义文本相似度评估资源贡献的基础之上。Luganda改编和持续扩展工作由SAGE PONDCaleb Matovu开发。

搜集汇总
数据集介绍
sts 数据集图片
构建方式
该数据集是对Semantic Textual Similarity (STS) Benchmark的卢干达语适配与扩展,由Caleb Matovu在SAGE POND主导开发。当前版本从原始STS Benchmark的测试集出发,手工翻译并调整了约200个句子对,特别强调在语言转换过程中保留句子间的语义关系,而非逐字直译。译文可依据卢干达语的表达习惯调整措辞、句法结构或词汇选择,以忠实呈现原句的语义关联。数据集正积极扩充中,测试集初步成型,开发集持续扩展,暂未包含训练集,旨在逐步构建一个较为全面的卢干达语语义相似度评估基准。
特点
该数据集的核心特点在于衡量模型对卢干达语句子对语义等价性的理解能力,其设计刻意规避了简单的词汇重叠或句法匹配,以甄别模型捕捉深层语义关系的水准。句子对可能以不同的词汇或语法结构表达近似含义,或共享相似词汇却语义相异,从而有效检测模型的语义泛化能力。当前规模虽小,却为早期版本提供了有价值的起点,未来将拓展至更多的语义关系类型和语言变体,以提升评价的广泛性和代表性。
使用方法
此基准适用于评估多种自然语言处理模型,包括卢干达语句子嵌入模型、语义相似度模型、跨语言表征模型、信息检索系统、多语言语言模型以及专精卢干达语的语言模型。研究者可借此检验模型对卢干达语语义相似性的判断能力,并分析语言模型改进是否带来语义表征质量的提升。亦可利用该数据集开发或微调相关模型,以强化其语义理解能力。鉴于当前数据量有限,解读评估结果时应结合数据规模,避免过度泛化。
背景与挑战
背景概述
Luganda STS Benchmark数据集由Caleb Matovu于2026年在SAGE POND机构创建,是对SemEval-2017任务1中STS Benchmark的卢干达语适配与扩展。该数据集旨在评估语言模型对卢干达语句对语义相似性的理解能力,核心研究问题在于超越词汇或句法层面的简单匹配,深入探究模型对语义关系的把握。作为低资源语言语义评估的重要资源,该数据集填补了卢干达语在语义文本相似性基准领域的空白,为卢干达语句嵌入模型、跨语言表示模型及多语言自然语言理解系统提供了关键的评测工具,对推动低资源语言语义建模研究具有奠基性意义。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。领域层面,卢干达语作为低资源语言,缺乏大规模标注语料,且语义相似性评测需应对表达多样性——不同词汇或语法结构可传达相同含义,而相似词项可能语义迥异,这对模型的深层语义理解构成显著考验。构建过程中,初始版本仅包含约200个测试集样本,规模有限且开发集尚未完成,难以全面反映语义关系的多样性。此外,人工语义适配而非逐字翻译的要求,增加了保持语义对等关系的难度,需在词汇选择与语法结构上精细调整,以确保跨语言语义一致性。
常用场景
经典使用场景
该数据集以卢干达语为对象,聚焦于语义文本相似度评估,其经典使用场景在于检验语言模型对卢干达语句对间语义关联的细腻捕捉能力。研究者可借助此基准,通过对比不同句法结构或词汇表达但语义等价的句对,以及表面相似却意义迥异的句对,精准度量模型在语义理解层面的鲁棒性,进而推动低资源语言语义表示学习的发展。
实际应用
在实际应用中,该数据集为卢干达语的句嵌入模型、语义相似度服务及信息检索系统提供了评测依据。它可用于优化跨语言表示学习,提升机器翻译中的语义保留度,并支撑语义搜索、智能问答等下游任务。随着数据规模的扩展,它还将促进卢干达语语言模型在落地方案中的精细调优,增进对乌干达地区用户查询意图的理解。
衍生相关工作
该数据集脱胎于SemEval-2017任务1中的STS Benchmark,并在其基础上进行了卢干达语的本土化改造,强调语义而非字面对应的忠实性。这一工作可望催生一系列衍生研究,如开发适合班图语系的语言理解基准、探索语义适配中的文化转换策略,以及构建跨语言语义知识对齐模型,进而推动多语种语义社区的共同进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务