sts-tr-dataset
收藏资源简介:
土耳其语语义文本相似度(STS)数据集,包含81对土耳其语句子,每对句子由两位标注者独立评估语义相似度,评分范围为0(完全不相关)至5(完全同义),最终分数为两位标注者评分的平均值。数据集分为两个子集:第一个子集(43对)来源于土耳其新闻RSS源和维基百科的句子,从527句原始池中手工配对;第二个子集(38对)来源于电影、烹饪和科普领域的网络句子。数据集包含以下字段:sentence1(第一句)、sentence2(第二句)、score(平均相似度得分,0-5之间的浮点数)。除了主数据集(sts_tr_dataset.parquet),还提供原始句子池(raw_sentences.csv,包含527句,附有来源、领域、类别、事件ID等元数据)以及构建脚本。该数据集适用于语义相似度模型的验证、嵌入质量检查等任务,但规模较小(81对),不适合作为基准测试,仅适合快速检查模型性能。数据集采用CC BY-SA 4.0许可。
Turkish Semantic Textual Similarity (STS) dataset, containing 81 pairs of Turkish sentences. Each pair is independently evaluated by two annotators for semantic similarity on a scale of 0 (completely unrelated) to 5 (completely synonymous), with the final score being the average of the two annotators. The dataset is divided into two subsets: the first subset (43 pairs) consists of sentences from Turkish news RSS feeds and Wikipedia, manually paired from an original pool of 527 sentences; the second subset (38 pairs) consists of web sentences from the domains of movies, cooking, and popular science. The dataset includes the following fields: sentence1 (first sentence), sentence2 (second sentence), and score (average similarity score, a float between 0 and 5). In addition to the main dataset (sts_tr_dataset.parquet), the original sentence pool (raw_sentences.csv, containing 527 sentences with metadata such as source, domain, category, event ID, etc.) and a construction script are provided. The dataset is suitable for tasks such as validation of semantic similarity models and embedding quality checks, but due to its small size (81 pairs), it is not suitable as a benchmark and is only appropriate for quick performance checks. The dataset is licensed under CC BY-SA 4.0.
数据集概述
Turkish STS Dataset 是一个土耳其语语义文本相似度(STS)数据集,包含 81 对土耳其语句子,由两位标注者独立在 0–5 量表上评分,最终发布的分数为两人评分的平均值。数据集规模小于 1K,许可协议为 CC BY-SA 4.0。
数据内容
-
句子来源:由两位贡献者创建,其中 43 对来自新闻 RSS 和维基百科,38 对来自网络上的电影、烹饪和通用科学领域内容。
-
数据列:
sentence1:第一句土耳其语sentence2:第二句土耳其语score:语义相似度(0–5,双精度)
-
评分分布(四舍五入到整数):
- 0 分:10 对
- 1 分:12 对
- 2 分:15 对
- 3 分:10 对
- 4 分:13 对
- 5 分:21 对
- 平均分:2.67,覆盖完整分数范围
构建方法
- 配对策略:不采用随机配对,而是通过人工策略使句子对覆盖整个相似度范围。核心思路是“找到两个独立来源对同一主题的各自描述”,从而产生真实词汇差异的释义句。
- 第一部分(新闻/维基百科):从 527 句原始语料池中手工挑选配对,利用元数据(如事件 ID)控制相似度层级。
- 第二部分(电影/烹饪/科学):将同一主题的不同描述进行配对,并逐步扩展到邻近主题和无关主题。
- 标注方式:两位标注者独立评分全部 81 对,发布分数为两者的平均值;未保留个人评分,因此无法重新计算标注者间一致性。
- 未使用任何预配对或预标注的语料库,所有配对均由人工完成。
原始语料池
包含 527 句(352 句新闻,175 句维基百科),跨 13 个主题类别。提供 id、domain、category、source、doc_id(同文章句子共享)、event_id(不同媒体对同一事件的报道共享)等列,以及来源文章 URL。
文件内容
sts_tr_dataset.parquet:81 对已评分数据(主数据集)pairs_to_score.csv:第一部分 43 对的评分结果sts_data.csv:第二部分 38 对的评分结果raw_sentences.csv:527 句原始语料池collect_raw.py、make_dataset.py:数据构建脚本
已知局限
- 规模小:81 对仅足以对嵌入模型进行初步检查,不足以作为基准测试。
- 仅发布平均分:无法重新计算标注者间一致性。
- 两半部分构成不同:平均句长和分数存在差异,风格与分数不完全独立。
- 第二部分缺乏来源 URL:38 对无法溯源到具体网页。
- 事件聚类基于词汇重叠:精度高但不全面。
- 新闻部分为单日快照:主题集中于当日新闻。
来源与许可
- 维基百科段落来自 Wikimedia REST API,文本遵循 CC BY-SA 4.0。
- 新闻内容来自 Hürriyet、Cumhuriyet、Anadolu Ajansı、BBC Türkçe、Euronews Türkçe、Habertürk、Milliyet 和 Independent Türkçe 的公共 RSS 源。
- 整个仓库许可为 CC BY-SA 4.0;新闻和网页内容为研究用途的短摘录,版权归原发布者所有,重新分发时需保留原始语料池的
source和url列。




