遇见数据集

mteb/STSBenchmarkv2

收藏
Hugging Face2026-07-05 更新2026-07-22 收录
官方服务:

资源简介:

STSBenchmark.v2是一个语义文本相似性基准数据集,属于大规模文本嵌入基准(MTEB)的一部分。该数据集用于评估模型对句子之间语义相似性的理解能力,任务类别为句子相似性。数据集包含来自博客、新闻和书面文本领域的句子对,每个句子对都有一个0到5分的相似性评分。此版本移除了验证集和测试集中的重复句子对,确保同一顺序无关的句子对在评估分割中不重复出现。数据集分为训练集(5749个样本)、验证集(1485个样本)和测试集(1362个样本),每个样本包括两个句子(sentence1和sentence2)和一个浮点数分数(score)。数据来源于mteb/stsbenchmark-sts,并经过额外处理以符合MTEB标准。

STSBenchmark.v2 is a semantic textual similarity benchmark dataset, part of the Massive Text Embedding Benchmark (MTEB). This dataset is designed for evaluating model performance on sentence similarity tasks, where the goal is to measure semantic similarity between sentence pairs. It covers domains including blog posts, news articles, and written texts. Each sentence pair is annotated with a similarity score ranging from 0 to 5. This version removes duplicate sentence pairs from the validation and test splits to ensure that the same order-insensitive pair does not appear more than once in an evaluation split or across splits. The dataset is split into train (5,749 examples), validation (1,485 examples), and test (1,362 examples) sets, with each example containing two sentences (sentence1 and sentence2) and a float score. It is sourced from mteb/stsbenchmark-sts and includes additional processing as part of the MTEB framework.

提供机构:
mteb
搜集汇总
数据集介绍
mteb/STSBenchmarkv2 数据集图片
构建方式
STSBenchmark.v2 数据集是在经典的语义文本相似度基准(STSbenchmark)基础上经过精细去重处理的升级版本。其构建过程首先从原始 STS 数据出发,针对验证集和测试集中出现的重复句对进行系统性清理,具体来说,当两个句子组合在顺序不敏感的情况下于同一评估划分中出现多次,或跨划分重复出现时,仅保留唯一的实例。这一策略确保了评估过程中不会因数据泄露或冗余而对模型性能产生不公影响,从而提升了基准测试的严谨性与可信度。
特点
该数据集的核心特质在于其严格的去重机制与高度结构化的评估设计。所有样本均由人工标注,聚焦于英文语义文本相似性任务,涵盖博客、新闻与书面语等多个领域。数据集分为训练、验证和测试三个子集,样本数量分别为5749、1485和1362,评分范围为0至5的连续浮点数,刻画了从完全不相关到语义等价的细腻差异。其统计信息进一步显示,验证和测试集均无重复句对,确保了评估的无偏性。
使用方法
研究人员可便捷地通过 MTEB(Massive Text Embedding Benchmark)框架调用此数据集,对文本嵌入模型进行标准化评估。具体操作流程为:首先利用 mteb 库中的 get_task 函数加载 STSBenchmark.v2 任务,随后使用 get_model 声明目标模型,最后调用 evaluate 方法执行评测。该方式不仅简化了实验流程,还保证了结果的横向可比性,适用于检验模型在细粒度语义相似度捕捉上的表现。
背景与挑战
背景概述
STSBenchmark.v2数据集由Philip May于2021年发起,作为大规模文本嵌入基准(MTEB)体系的重要组成部分,由Kenneth Enevoldsen等人在MMTEB项目中进一步优化。该数据集聚焦于语义文本相似性(STS)任务,旨在为自然语言处理模型提供高质量的句子对相似度评分基准。其核心研究问题在于评估嵌入模型对语义等价性的捕捉能力,涵盖博客、新闻和书面语等多领域文本。该版本通过剔除跨拆分中重复的无序句子对,显著提升了评估的严谨性与可靠性,对文本嵌入模型的公平比较与发展具有重要推动作用。
当前挑战
该数据集所解决的领域问题在于,现有STS基准常因重复样本导致模型性能评估失真,难以准确衡量语义表示的泛化能力。构建过程中的挑战包括:需从原始STSBenchmark中识别并移除存在于验证集和测试集间或拆分内部的相同无序句子对,这要求对大规模文本进行精确的重复检测与过滤;同时,确保去重后的样本仍保持代表性,避免因数据缩减而削弱任务难度和多样性。此外,多领域文本的覆盖增加了标注一致性维护的复杂性,平衡不同来源语料的语义粒度也是一大考验。
常用场景
经典使用场景
STSBenchmark.v2在自然语言处理领域中被广泛用于评估语义文本相似度模型的性能。该数据集涵盖了博客、新闻及书面语等多元领域,通过提供成对句子及其人工标注的相似度得分(0至5分),为语义表征学习提供了一个标准化的测试基准。研究者通常利用其训练集来微调句子嵌入模型,并通过验证集和测试集衡量模型对语义等价的捕捉能力,从而推动模型在细粒度语义理解上的进步。
衍生相关工作
STSBenchmark.v2衍生出多项经典工作,其中最引人瞩目的是其作为MTEB(大规模文本嵌入基准)子任务的核心地位。MTEB通过整合该数据集及其他多语言、多模态评测任务,催生了如MMTEB(大规模多语言文本嵌入基准)等拓展研究,推动了多语言语义模型的系统性评估。此外,基于该数据集的改进版本用于开发句子Transformer的对比学习策略,进一步启发了SimCSE、Sentence-BERT等里程碑式模型在语义表征上的创新。
数据集最近研究
最新研究方向
STSBenchmark.v2作为大规模文本嵌入基准评测(MTEB)体系中的核心语义文本相似度任务,其发布标志着文本表示学习评估标准迈向更严谨的数据净化阶段。该版本通过剔除验证集与测试集中因顺序不变性而出现的重复句对,显著提升了基准评测的公平性与可靠性,避免了数据泄露对模型泛化能力的干扰。在当下多模态与跨语言嵌入技术蓬勃发展的浪潮中,例如MMTEB(大规模多语言文本嵌入基准)的提出,STSBenchmark.v2为评估单语及多语言语义相似度模型提供了更干净的测试环境,成为衡量句向量质量的关键标尺。其与MTEB生态的深度整合,推动了如Sentence-BERT等预训练模型在信息检索、自然语言推理等前沿应用中性能验证的标准化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务