遇见数据集

sts-tr-magibu

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

STS-TR是一个面向土耳其语的语义文本相似度(STS)数据集,由学生团队项目创建,参考了trmteb/stsb-tr数据集的结构。该数据集旨在支持土耳其语句子对的语义相似性分析和相关研究。数据集包含70个句子对,其中15对由人工完全手动编写,并特别包含了11对完全无关的句子。句子对覆盖了不同的语义关系级别:相同或几乎相同、高度相似、部分相似或相关主题、弱相关、反义以及完全无关。数据集包含三个字段:sentence1(第一句)、sentence2(第二句)和score(语义相似度分数,初始为空,由评分者根据0-1的尺度手动标注)。评分参考尺度包括:1.00(完全相同)、0.75(高度相似)、0.50(部分相似或相关主题)、0.25(弱相关)、0.00(完全无关),允许使用中间值进行更细致的评分。数据集以CSV格式存储,采用CC BY 4.0许可证,适用于教育和小规模土耳其语语义相似度研究。

STS-TR is a Turkish Semantic Textual Similarity (STS) dataset created by a student team project, referencing the structure of the trmteb/stsb-tr dataset. It aims to support semantic similarity analysis and related research on Turkish sentence pairs. The dataset contains 70 sentence pairs, of which 15 are manually written entirely by humans, and includes 11 completely unrelated pairs. The pairs cover different levels of semantic relation: identical or almost identical, highly similar, partially similar or related topics, weakly related, opposite meaning, and completely unrelated. The dataset has three fields: sentence1, sentence2, and score (a semantic similarity score initially empty, manually annotated by raters on a 0-1 scale). The reference scale includes: 1.00 (identical), 0.75 (highly similar), 0.50 (partially similar or related topic), 0.25 (weakly related), 0.00 (completely unrelated), with intermediate values allowed for finer granularity. The dataset is stored in CSV format, licensed under CC BY 4.0, and suitable for educational and small-scale Turkish semantic similarity research.

创建时间:
2026-08-06
原始信息汇总

STS-TR Türkçe Cümle Benzerliği Veri Seti

数据集概述

STS-TR,全称为“STS-TR Öğrenci Grup Projesi”,是一个用于土耳其语语义文本相似度(STS)研究的小规模数据集。该数据集由学生小组项目制作,参考了 Hugging Face 上的 trmteb/stsb-tr 数据集结构,旨在为土耳其语句子对的语义相似度分析提供数据资源。

基本信息

  • 语言: 土耳其语(tr)
  • 许可证: CC BY 4.0
  • 任务类别: 句子相似度(sentence-similarity)
  • 标签: STS、语义文本相似度、语义分析、土耳其语
  • 数据集规模: n < 1K(少于1000个样本)
  • 配置文件: default(包含一个训练集,数据文件为 sts_tr_dataset.csv

数据内容

数据集共包含 70 对土耳其语句子,其中:

  • 15 对 完全由人工编写
  • 11 对 为完全不相关的句子

其余句子对覆盖了不同语义关联程度,包括:

  • 意义相同或几乎相同的句子
  • 高度相似的句子
  • 部分相似或涉及同一主题的句子
  • 低度相关的句子
  • 意义相反的句子
  • 完全无关的句子

数据列说明

列名 描述
sentence1 句子对中的第一个句子
sentence2 句子对中的第二个句子
score 两句之间的语义相似度分数

注意: score 列在首次上传时被有意留空,计划由小组成员根据语义关联程度在 0 到 1 之间 进行打分。

评分标准

分数 语义关联程度
1.00 句子意义相同或几乎相同
0.75 句子高度相似
0.50 句子部分相似或主题相关
0.25 句子之间存在弱语义关联
0.00 句子完全不相关

可以使用中间值(如 0.60 或 0.85)以更细致地反映相似度程度。

文件结构

数据集包含两个文件:

  • README.md
  • sts_tr_dataset.csv

CSV 文件包含三列:sentence1,sentence2,score

参考来源

参考数据集:trmteb/stsb-tr

许可证

该数据集以 CC BY 4.0 许可证发布,仅供教育用途使用。

搜集汇总
数据集介绍
sts-tr-magibu 数据集图片
构建方式
该数据集是依据土耳其语语义文本相似度基准数据集trmteb/stsb-tr的结构,由学生小组协作构建的小规模STS数据集。构建过程中,团队精心设计了70对土耳其语句子对,其中15对为完全人工撰写,特别包含11对完全无关的句子对,以覆盖从语义等同到完全无关的多层次关联。每个样本由sentence1、sentence2和score三个字段组成,其中score字段在初始发布时被有意留空,交由另一名成员依据0到1的语义相似度标尺进行评分,评分可细化为0.25、0.50、0.75、1.00等梯度,并允许使用中间值以增强区分度。数据集以CSV格式存储,兼容Hugging Face Dataset Viewer,并采用CC BY 4.0许可,旨在为土耳其语语义分析研究提供小型但结构严谨的测试资源。
使用方法
该数据集可直接用于训练和评估土耳其语语义文本相似度模型,加载时可通过Hugging Face Datasets库的load_dataset函数读取CSV格式的默认配置。由于score字段初始为空,使用者需自行完成标注或利用已有模型进行预测填充。推荐将数据集划分为训练集和验证集,以微调多语言或土耳其语专用的句子编码器,如BERTurk或XLM-R。同时,数据集的分层结构支持针对不同语义关联度进行细粒度评估,例如计算每一等级上的准确率或Spearman相关系数。此外,低规模特性使其成为快速原型验证的理想选择,便于在有限计算资源下测试新的相似度算法。最终,配合CC BY 4.0许可,研究者可自由用于学术和教育目的。
背景与挑战
背景概述
语义文本相似度(STS)作为自然语言处理领域的基础任务,旨在量化句子对之间的语义等价程度,其研究对于机器翻译评估、信息检索及对话系统等应用具有深远意义。然而,现有大规模STS数据集多集中于英语等资源丰富的语言,土耳其语等低资源语言的相关资源相对匮乏。在此背景下,由土耳其学生团队于近期创建的STS-TR Magibu数据集应运而生,该数据集以Hugging Face平台上的trmteb/stsb-tr为参照,旨在为土耳其语的语义分析研究提供一个小规模、高质量的评测基准。尽管仅含70对句子,但其通过精心设计的不同语义关系层级,涵盖了从同义到完全无关的多种情况,为土耳其语STS任务的模型开发与评估提供了初步的语料支撑,也体现了学术共同体对多语言语义理解资源建设的积极探索。
当前挑战
该数据集所面临的挑战首先来自其极小的规模(不足百对样本),这限制了基于深度学习的语义相似度模型在该数据上的训练与泛化能力,难以充分捕捉土耳其语复杂的句法结构和语义变异。其次,在构建过程中,句子对的生成与评分依赖于人工判断,主观性难以避免,且初始版本中‘score’字段的有意留白导致标注一致性缺乏基准,后续由单一成员补全分数可能引入标注偏差。此外,数据集中人为设置的11对完全无关句子虽有助于评估模型的辨别力,但可能造成分布偏移,影响模型在真实场景中的稳健性。最后,作为学生项目,其标注规范的完整性和外部验证的缺失,也对数据集在学术研究中的可复现性与可信度构成挑战。
常用场景
经典使用场景
STS-TR magibu数据集作为土耳其语语义文本相似度研究的小规模基准,其经典使用场景在于评估和比较不同语义相似度模型在土耳其语上的性能。研究者可利用该数据集的70对句子,涵盖从完全同义到完全无关的多种语义关系,对模型进行微调或零样本评估,以检验模型对土耳其语语义细微差别的捕捉能力。由于数据集规模较小,它特别适合作为快速验证模型架构或训练策略的‘试金石’,在资源有限或初步探索阶段发挥重要作用。
解决学术问题
该数据集解决了土耳其语自然语言处理中语义相似度标注资源稀缺的学术难题。在此之前,土耳其语缺乏公开可用的小规模、高质量STS数据集,限制了相关研究的开展。通过提供包含明确语义分级(如0.00、0.25、0.50、0.75、1.00)的句子对,本数据集支持语义表示学习、句子嵌入评估以及跨语言迁移学习等前沿课题,为低资源语言的语义分析研究提供了可行性验证的宝贵资源,推动了土耳其语NLP技术的学术进步。
实际应用
在实际应用中,STS-TR magibu数据集可辅助构建土耳其语语义搜索引擎、智能问答系统及文本挖掘工具。例如,在信息检索中,该数据集可用于优化查询与文档的相似度匹配算法,提升搜索结果的相关性;在客服自动化中,可训练模型识别用户问题与知识库条目的语义等价性,实现精准应答。此外,它还适用于学术评估场景,为土耳其语学习者的语言能力测试提供语义相似度参考,或用于教育内容推荐系统,实现学习材料的智能关联。
数据集最近研究
最新研究方向
在自然语言处理领域,语义文本相似度(STS)作为衡量文本语义等价性的核心任务,持续驱动着多语言与低资源场景下的模型评估与优化。STS-TR数据集的构建紧跟这一前沿趋势,其以土耳其语为对象,通过精心设计涵盖同义、近义、部分相关、弱相关及完全无关的多层次语义梯度,为土耳其语语义分析研究提供了细粒度的基准资源。该数据集尤其关注小样本学习与人工标注质量,其70对语句中嵌入11对完全无关样本,旨在挑战模型的判别能力。作为对trmteb/stsb-tr的补充,它推动了语义表示在低资源语言上的验证,并与多语种STS基准的扩展趋势相呼应,对促进土耳其语自然语言理解、检索及对话系统的鲁棒性评估具有积极意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务