遇见数据集

turkish-sts-dataset

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

该数据集是一个土耳其语句子语义相似度数据集,包含40个训练样本。每个样本由两个句子(sentence1 和 sentence2)以及一个表示它们之间相似度的浮点数分数(score)组成。数据集适用于句子相似度计算、语义匹配等自然语言处理任务。数据规模较小,仅为40个样本,可用于原型开发或小规模测试。

This dataset is a Turkish sentence semantic similarity dataset containing 40 training samples. Each sample consists of two sentences (sentence1 and sentence2) and a floating-point score indicating their similarity. The dataset is suitable for natural language processing tasks such as sentence similarity computation and semantic matching. With only 40 samples, it is small-scale and can be used for prototype development or small-scale testing.

创建时间:
2026-08-06
原始信息汇总

数据集概述

此数据集为土耳其语语义文本相似度(STS)数据集,由人工标注构建,属于句子相似度任务数据集。

基本信息

  • 语言:土耳其语(tr)
  • 任务类别:句子相似度(sentence-similarity)
  • 数据规模:少于1K条样本(n<1K)
  • 标签:sts、turkish、manual、magibu

数据内容与结构

  • 特征字段
    • sentence1(字符串):待比较的第一句
    • sentence2(字符串):待比较的第二句
    • score(浮点数):两句话之间的相似度评分
  • 数据划分:仅包含训练集(train),共40条样本,总大小4625字节
  • 文件格式:数据存放在 data/train-* 路径下,支持默认配置(config_name: default)

其他说明

  • 下载大小:5575字节
  • 数据集总大小:4625字节(压缩前)
搜集汇总
数据集介绍
turkish-sts-dataset 数据集图片
构建方式
该数据集聚焦于土耳其语语义文本相似度任务,通过人工标注方式构建,包含40对句子对,每对句子由sentence1和sentence2组成,并赋予0到5之间的相似度评分,以float64类型存储,确保评分精度。数据总量不足1K,以训练集形式提供,文件采用parquet格式存储,便于高效读取与处理。
特点
该数据集的核心特点在于其小规模、高质量的人工标注特性,适用于土耳其语语义相似度研究的基准测试。其独特之处在于完全基于母语者的人工判断,保证了标注的准确性和文化语境的一致性。数据集的简洁结构(仅含文本和评分)降低了使用门槛,使得研究者能够快速进行模型评估与对比。
使用方法
该数据集可直接用于训练或评估土耳其语句子相似度模型,通过加载train-*.parquet文件,利用HuggingFace数据集API(如load_dataset)即可获取数据。用户可将其用于监督学习中的回归任务,预测句子对的相似度分数,也可作为微调多语言或土耳其语专用语义模型(如BERTurk)的验证集,以检验模型在低资源语言上的表现。
背景与挑战
背景概述
土耳其语语义文本相似度数据集(turkish-sts-dataset)由Magibu团队于近年构建,旨在填补土耳其语在语义相似度评估任务中的资源空白。该数据集包含40对人工标注的句子对,评分基于语义相似度(0-5分),规模虽小但标注质量高,为土耳其语自然语言处理研究提供了基准。其核心研究问题在于如何有效衡量土耳其语中句子间的语义等价性,这对其在信息检索、问答系统及文本生成评估等领域具有重要影响。该数据集的发布为低资源语言(如土耳其语)的语义表示学习研究提供了宝贵的实验材料,推动了多语言语义相似度模型的本土化验证与发展。
当前挑战
领域层面,语义文本相似度(STS)任务要求模型捕捉句子的深层语义而非表面词汇重叠,土耳其语作为黏着语,其丰富的词形变化和自由语序加剧了语义等价判定的难度,尤其是在缺乏大规模预训练语料的情境下。构建过程中,挑战十分显著:首先,人工标注需要跨语言专家确保评分一致性和文化语境适配,而样本量仅40对,易受标注者主观偏差影响;其次,数据集规模过小(n<1K)导致模型训练易过拟合,难以泛化至多样化的现实场景;最后,缺乏配套的交叉验证划分或外部基准,使结果的可比性和可靠性面临考验。这些挑战凸显了在低资源语言中构建高质量、标准化语义评估资源的迫切性与复杂性。
常用场景
经典使用场景
该数据集作为土耳其语语义文本相似度(STS)任务的基准资源,在自然语言处理领域具有独特价值。其经典使用场景聚焦于评估和比较不同模型对土耳其语句子对语义等价性的捕捉能力。研究者可基于此数据集训练或微调回归模型,以预测给定句子对的相似度分数(0-5),从而衡量模型在跨语言语义理解上的表现。由于数据规模小巧(40对),它尤其适用于小样本学习、少样本场景下的模型验证,以及作为土耳其语STS任务的标准化测试集,为多语言语义表征研究提供对比基准。
实际应用
在实际应用层面,该数据集可服务于土耳其语信息检索、问答系统、文本摘要和机器翻译评估等场景。例如,在搜索引擎中利用语义相似度模型改进查询与文档的匹配精度;在对话系统中检测用户意图的语义等价性以优化响应;在文本复述检测中识别同一语义的不同表述。此外,该数据集亦可作为教育评估工具,用于衡量学生文本答案与标准答案的相似度,或辅助内容审核系统识别语义上重复或违规的文本。其小规模特性便于快速原型验证,适合工业界在资源受限环境下部署轻量级语义模型。
衍生相关工作
该数据集的设计与发布激发了多项后续研究。一方面,它作为基准成为土耳其语STS任务的重要衡量标准,衍生出针对土耳其语优化的语义相似度模型研究,例如基于Transformer架构的微调策略探索。另一方面,其构建方法(人工标注、规模控制)为其他低资源语言(如阿拉伯语、斯瓦希里语)的STS数据集开发提供了范式参考。此外,该数据集常被用于跨语言迁移学习实验,验证多语言模型在零样本或小样本条件下的性能,从而推动了多语语义表征研究的深入。相关衍生工作还包括数据增强技术、对抗性样本生成等在土耳其语STS任务上的应用尝试,进一步丰富了该领域的方法论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务