遇见数据集

Turkish_STS_Emotional_Dataset

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

该数据集名为“Türkçe Cümle Benzerliği Veri Seti”,用于衡量两个土耳其语句子之间的语义相似度。其结构参考了 trmteb/stsb-tr 数据集。每个样本包含三个字段:sentence1(第一个句子,字符串)、sentence2(第二个句子,字符串)和 score(语义相似度得分,浮点数)。数据集共包含70个句子对,其中训练集60对,测试集10对。数据来源与标注:测试集的前5对和训练集的前20对为人工编写,其余部分由AI辅助生成。句子对的创建和数据集划分由Umay ŞAMLI完成,语义相似度评分由Şakir KOÇ进行人工标注,评分范围为0到5的整数(0:语义完全不同,1:非常低的相关性,2:部分共同元素但差异显著,3:整体意思相似但存在明显差异,4:语义高度相似,5:相同或几乎相同)。数据以Parquet格式存储,文件分别为 data/train.parquet 和 data/test.parquet。该数据集适用于土耳其语句子相似度计算、语义匹配、自然语言理解等任务。

The dataset is named Türkçe Cümle Benzerliği Veri Seti and is used to measure semantic similarity between two Turkish sentences. Its structure references the trmteb/stsb-tr dataset. Each sample contains three fields: sentence1 (first sentence, string), sentence2 (second sentence, string), and score (semantic similarity score, float). The dataset consists of 70 sentence pairs, with 60 in the training set and 10 in the test set. Data sources and annotation: The first 5 pairs of the test set and the first 20 pairs of the training set are manually written, while the rest are AI-assisted generated. The creation of sentence pairs and dataset splitting were done by Umay ŞAMLI, and semantic similarity scores were manually annotated by Şakir KOÇ, with scores ranging from 0 to 5 integers (0: semantically completely different, 1: very low relevance, 2: partially shared elements but significant differences, 3: overall meaning similar but with notable differences, 4: highly semantically similar, 5: identical or nearly identical). Data is stored in Parquet format, with files data/train.parquet and data/test.parquet. This dataset is suitable for tasks such as Turkish sentence similarity computation, semantic matching, and natural language understanding.

创建时间:
2026-08-05
原始信息汇总

数据集概述

该数据集是一个用于土耳其语语义相似度测量的数据集,包含70个句子对及其相似度评分。

数据集结构

每条记录包含以下三个字段:

  • sentence1 (string):第一个句子
  • sentence2 (string):第二个句子
  • score (float64):语义相似度评分

数据划分

数据集共分为两个子集,总计70条记录:

子集 记录数
train 60
test 10

数据生成与评分

  • 测试子集中的前5对句子以及训练子集中的前20对句子为人工制作,保留了原始文本未作修改;其余5对测试句子和40对训练句子由人工智能辅助生成。
  • 所有70对句子均经人工评估,评分范围为0至5的整数,具体含义如下:
    • 0:语义上完全不同的句子
    • 1:存在非常低的语义关联
    • 2:包含一些共同点,但意义有显著差异
    • 3:整体语义相似,但存在明显差异
    • 4:语义上相当相似
    • 5:意义相同或几乎相同

文件格式

数据以Parquet格式存储,包含两个文件:

  • data/train.parquet:60对句子
  • data/test.parquet:10对句子

贡献者

  • Umay ŞAMLI:负责句子对的构建、训练/测试划分的生成以及数据集结构的设计。
  • Şakir KOÇ:负责对70对句子进行基于0-5分制的人工语义相似度评分。
搜集汇总
数据集介绍
Turkish_STS_Emotional_Dataset 数据集图片
构建方式
本数据集专为土耳其语语义相似度度量而设计,其构建灵感源自 trmteb/stsb-tr 数据集的架构范式。数据集中每条样本由一对土耳其语句子及其语义相似度评分构成,评分采用浮点数表示。整个数据集包含 60 条训练样本与 10 条测试样本,合计 70 条记录。在构建过程中,测试集的前 5 对与训练集的前 20 对句子均为人工原创且未加改动,而其余 5 对测试句与 40 对训练句则借助人工智能技术辅助生成。句对编写与数据划分工作由 Umay ŞAMLI 完成,而语义相似度评分则由 Şakir KOÇ 基于人工评估赋予 0 至 5 之间的整数值,其中 0 代表语义完全相异,5 代表语义等同或近乎等同,以此确保评分的严谨性与一致性。
特点
该数据集的核心特点在于其规模紧凑却富含层次,总共 70 条样本虽数量有限,但通过混合人工与 AI 生成句对的方式,兼顾了真实性与多样性。评分体系采用离散的 0 至 5 整数分,便于直观理解与计算,同时避免了冗余的连续值。数据集的构造分工明确,句子创作与评分任务分离,降低了主观偏差。此外,作为土耳其语资源,它填补了低资源语言在语义相似度评估方面的空白,为跨语言研究提供了宝贵的基础数据。其训练与测试划分比例约为 6:1,适合作为小样本场景下的算法验证基准,尤其适用于探索数据增强或少样本学习技术。
使用方法
使用时,用户可直接加载 Parquet 格式的数据文件,其中 train.parquet 含 60 条训练样本,test.parquet 含 10 条测试样本。每条样本包含 sentence1、sentence2 与 score 三个字段,分别代表语义相似度模型的输入句对与目标标签。鉴于数据集规模较小,建议结合迁移学习或预训练语言模型进行微调,并可采用交叉验证或集成方法以提升评估稳定性。同时,由于评分范围限定为整数 0 至 5,模型输出可调整至该区间,并采用均方误差或皮尔逊相关系数作为评估指标。研究者亦可基于此数据集构建基线,对比不同模型在土耳其语语义匹配任务上的表现,或将其扩展至多语言场景,以检验模型的跨语言泛化能力。
背景与挑战
背景概述
Turkish_STS_Emotional_Dataset 数据集由 Umay ŞAMLI 与 Şakir KOÇ 于近期构建,旨在推动土耳其语语义文本相似度(STS)研究。该数据集以 trmteb/stsb-tr 为蓝本,包含70对土耳其语句子,每对由人工或AI辅助生成,并依据0至5的评分标准由人类专家进行语义相似度标注。其核心研究问题在于评估和提升土耳其语自然语言处理模型对语义相似性的理解能力,填补了土耳其语在STS任务上高质量标注数据的空白,对多语言语义理解研究具有重要参考价值。
当前挑战
该数据集面临的挑战在于土耳其语的形态丰富性与低资源特性,使得语义相似度判别尤为复杂,现有模型泛化能力有限。构建过程中,仅70对样本的规模偏小,且需兼顾人工与AI生成句子的语义一致性,评分标准虽明确但人为判断易存分歧,标注者间的一致性验证缺失。此外,数据集的领域覆盖单一,未充分纳入方言、口语及专业术语,限制了其在实际应用中的鲁棒性。如何在小样本条件下提升模型性能并扩展数据多样性,仍是核心挑战。
常用场景
经典使用场景
土耳其语句子语义相似度数据集(Turkish_STS_Emotional_Dataset)为自然语言处理领域中的语义文本相似度(STS)任务提供了宝贵的资源。该数据集包含70对人工评分(0-5分)的土耳其语句子对,其中训练集60对、测试集10对,每对句子均附带细粒度的语义相似度标注。这一结构使得它成为评估和微调语义相似度模型的理想基准,尤其适用于土耳其语这一资源相对稀缺的语言。研究者可借助本数据集开展跨语言的语义表示学习、句子嵌入质量评估以及监督式相似度回归等经典研究,从而推动低资源语言语义理解技术的进步。
解决学术问题
该数据集解决了土耳其语语义相似度评估研究中的数据匮乏问题。在学术层面,它为语义文本相似度的基准测试提供了首个规模虽小但标注质量高的土耳其语数据集,填补了该语言在STS任务上的空白。通过提供人类标注的相似度分数,支持了无监督与有监督语义相似度算法的量化比较,促进了语义表示模型在土耳其语上的适应与优化。其意义在于为低资源语言的语义理解研究提供了可复现的评估基础,有助于验证多语言模型的跨语言泛化能力,并推动自然语言处理技术在非英语环境中的发展。
衍生相关工作
围绕该数据集,可衍生出若干研究方向与经典工作。其一,利用该数据集微调多语言预训练模型(如BERTurk、XLM-R)以构建土耳其语专用的语义相似度模型,并探索不同池化策略与对齐损失的效果。其二,开展跨语言迁移学习研究,将以英语为主训练的STS模型迁移至土耳其语,并对迁移性能进行系统评估。其三,结合数据集中的情感标签(隐含于原始任务)开展情感相似度与语义相似度联合建模的探索,推动情感计算与语义理解的交叉融合。其四,基于该数据集的构建经验,可发展自动化数据标注方法(如利用大语言模型生成与评分),为其他低资源语言建立类似基准提供方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务