遇见数据集

sts-tr-dataset

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

土耳其语语义文本相似度(STS)数据集,包含81对土耳其语句子,每对句子由两位标注者独立评估语义相似度,评分范围为0(完全不相关)至5(完全同义),最终分数为两位标注者评分的平均值。数据集分为两个子集:第一个子集(43对)来源于土耳其新闻RSS源和维基百科的句子,从527句原始池中手工配对;第二个子集(38对)来源于电影、烹饪和科普领域的网络句子。数据集包含以下字段:sentence1(第一句)、sentence2(第二句)、score(平均相似度得分,0-5之间的浮点数)。除了主数据集(sts_tr_dataset.parquet),还提供原始句子池(raw_sentences.csv,包含527句,附有来源、领域、类别、事件ID等元数据)以及构建脚本。该数据集适用于语义相似度模型的验证、嵌入质量检查等任务,但规模较小(81对),不适合作为基准测试,仅适合快速检查模型性能。数据集采用CC BY-SA 4.0许可。

Turkish Semantic Textual Similarity (STS) dataset, containing 81 pairs of Turkish sentences. Each pair is independently evaluated by two annotators for semantic similarity on a scale of 0 (completely unrelated) to 5 (completely synonymous), with the final score being the average of the two annotators. The dataset is divided into two subsets: the first subset (43 pairs) consists of sentences from Turkish news RSS feeds and Wikipedia, manually paired from an original pool of 527 sentences; the second subset (38 pairs) consists of web sentences from the domains of movies, cooking, and popular science. The dataset includes the following fields: sentence1 (first sentence), sentence2 (second sentence), and score (average similarity score, a float between 0 and 5). In addition to the main dataset (sts_tr_dataset.parquet), the original sentence pool (raw_sentences.csv, containing 527 sentences with metadata such as source, domain, category, event ID, etc.) and a construction script are provided. The dataset is suitable for tasks such as validation of semantic similarity models and embedding quality checks, but due to its small size (81 pairs), it is not suitable as a benchmark and is only appropriate for quick performance checks. The dataset is licensed under CC BY-SA 4.0.

创建时间:
2026-08-05
原始信息汇总

数据集概述

Turkish STS Dataset 是一个土耳其语语义文本相似度(STS)数据集,包含 81 对土耳其语句子,由两位标注者独立在 0–5 量表上评分,最终发布的分数为两人评分的平均值。数据集规模小于 1K,许可协议为 CC BY-SA 4.0。

数据内容

  • 句子来源:由两位贡献者创建,其中 43 对来自新闻 RSS 和维基百科,38 对来自网络上的电影、烹饪和通用科学领域内容。

  • 数据列

    • sentence1:第一句土耳其语
    • sentence2:第二句土耳其语
    • score:语义相似度(0–5,双精度)
  • 评分分布(四舍五入到整数):

    • 0 分:10 对
    • 1 分:12 对
    • 2 分:15 对
    • 3 分:10 对
    • 4 分:13 对
    • 5 分:21 对
    • 平均分:2.67,覆盖完整分数范围

构建方法

  • 配对策略:不采用随机配对,而是通过人工策略使句子对覆盖整个相似度范围。核心思路是“找到两个独立来源对同一主题的各自描述”,从而产生真实词汇差异的释义句。
    • 第一部分(新闻/维基百科):从 527 句原始语料池中手工挑选配对,利用元数据(如事件 ID)控制相似度层级。
    • 第二部分(电影/烹饪/科学):将同一主题的不同描述进行配对,并逐步扩展到邻近主题和无关主题。
  • 标注方式:两位标注者独立评分全部 81 对,发布分数为两者的平均值;未保留个人评分,因此无法重新计算标注者间一致性。
  • 未使用任何预配对或预标注的语料库,所有配对均由人工完成。

原始语料池

包含 527 句(352 句新闻,175 句维基百科),跨 13 个主题类别。提供 iddomaincategorysourcedoc_id(同文章句子共享)、event_id(不同媒体对同一事件的报道共享)等列,以及来源文章 URL。

文件内容

  • sts_tr_dataset.parquet:81 对已评分数据(主数据集)
  • pairs_to_score.csv:第一部分 43 对的评分结果
  • sts_data.csv:第二部分 38 对的评分结果
  • raw_sentences.csv:527 句原始语料池
  • collect_raw.pymake_dataset.py:数据构建脚本

已知局限

  • 规模小:81 对仅足以对嵌入模型进行初步检查,不足以作为基准测试。
  • 仅发布平均分:无法重新计算标注者间一致性。
  • 两半部分构成不同:平均句长和分数存在差异,风格与分数不完全独立。
  • 第二部分缺乏来源 URL:38 对无法溯源到具体网页。
  • 事件聚类基于词汇重叠:精度高但不全面。
  • 新闻部分为单日快照:主题集中于当日新闻。

来源与许可

  • 维基百科段落来自 Wikimedia REST API,文本遵循 CC BY-SA 4.0。
  • 新闻内容来自 Hürriyet、Cumhuriyet、Anadolu Ajansı、BBC Türkçe、Euronews Türkçe、Habertürk、Milliyet 和 Independent Türkçe 的公共 RSS 源。
  • 整个仓库许可为 CC BY-SA 4.0;新闻和网页内容为研究用途的短摘录,版权归原发布者所有,重新分发时需保留原始语料池的 sourceurl 列。
搜集汇总
数据集介绍
sts-tr-dataset 数据集图片
构建方式
土耳其语STS数据集的构建匠心独运,其核心在于摒弃随机配对,转而采纳一种基于元数据的策略性配对方法。数据集由两部分构成:其一,从新闻RSS源与维基百科中采集527个句子,利用文章归属、事件标识等元数据进行手工配对,确保语义相似度覆盖全谱系;其二,针对电影、烹饪与科普领域,收集同一主题的多源描述,形成互为释义的句子对。两独立标注者对所有句子对进行0-5级评分,最终得分为二者均值,以最小化个体偏差,从而构筑一个规模虽小却脉络清晰的语义相似度基准。
特点
该数据集独树一帜地囊括了81对土耳其语句子,其相似度分数完整覆盖0至5全区间,均值为2.67,呈现均衡分布。尤为珍贵的是,数据集中刻意保留了若干‘看似相关实则语义迥异’的句子对,如不同事件因高频词重叠而被聚类,此类样本是区分语义理解模型与词袋基线方法的试金石。此外,构建过程完全摒弃预配对语料,所有配对均源于人工深思熟虑,确保了词汇差异的自然性与真实性,为土耳其语语义相似度研究提供了极具挑战性的评估素材。
使用方法
该数据集的使用便捷高效,可通过HuggingFace Datasets库一键加载,代码为`load_dataset("Erenyanic/sts-tr-dataset")`。其标准的三列结构(含两个句子与相似度得分)可直接用于微调或评估句子嵌入模型,亦可通过计算模型预测分数与人工评分间的相关系数来检验语义表示质量。值得注意的是,鉴于其小规模特性,该数据集更适合作为模型精度的快速验证工具,而非全面基准。同时,配套的原始句子池及详细的元数据为研究者提供了二次挖掘与扩展的潜力。
背景与挑战
背景概述
土耳其语语义文本相似度(STS)数据集(sts-tr-dataset)由Erenyanic与nursimakgul于2026年构建,共包含81对人工评分(0-5分)的土耳其语句子对,并附带527句的原始语料池。该数据集旨在填补土耳其语在语义相似度评估领域的空白,为embedding模型提供小型但高质量的验证资源。其构建特色在于通过跨领域(新闻、百科、影视、烹饪、科学)的配对策略,刻意覆盖完整相似度区间,尤其保留高词汇重叠但低语义相似度的“陷阱”样本,以强化模型对语义等价与词汇表面相似性的区分能力。尽管规模较小,该数据集为土耳其语NLP社区提供了首个可复现的STS基准,推动了低资源语言语义评估研究的发展。
当前挑战
该数据集面临的挑战体现在两个方面:其一,领域问题方面,土耳其语STS研究长期依赖机器翻译或零样本迁移,缺乏本土化标注资源,尤其缺少能准确反映语义梯度(而非二元分类)的细粒度评分数据,这导致模型评估失真。其二,构建过程中,为确保配对句子语义跨度均匀而非自然分布下99%的零分样本,需手工从多源文本中遴选语义关联度各异的句子对,工作量巨大且依赖标注者判断。此外,仅发布平均分而丢失个人评分,限制了一致性检验;语料来源差异(新闻vs百科)导致长度与得分不独立,且部分样本无法追溯URL,均为后续扩展与复现带来困难。
常用场景
经典使用场景
该数据集作为土耳其语语义文本相似度(STS)任务的标注资源,包含81对由两位标注者独立评分(0-5分制)的句子对,覆盖新闻、百科、影视、烹饪及科学等多个领域,其分数分布均匀,为土耳其语句子嵌入模型、语义搜索及文本蕴含研究提供了高质量的基准测试集。
解决学术问题
该数据集解决了土耳其语STS领域缺乏人工标注语料的问题,其构建方法注重配对策略而非随机抽样,确保覆盖从完全同义到完全无关的完整相似度区间,为评估多语言模型(如mBERT、XLM-R)在低资源语言上的语义理解能力提供了可靠参照,推动了土耳其语自然语言处理的研究进展。
衍生相关工作
该数据集衍生的工作包括土耳其语STS的扩展研究(如增加句子对数量或引入多标注者一致性分析)、跨语言语义相似度迁移学习的探索,以及与土耳其语NLI数据集的联合训练,以增强模型的语义推理能力。此外,其构建方法论也为其他低资源语言STS数据集的创建提供了可复制的范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务