遇见数据集

STS-Dino

收藏
arXiv2021-10-04 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

STS-Dino是由慕尼黑大学信息与语言处理中心开发的自动生成文本相似度数据集,无需人工标注。该数据集包含121,275条数据,通过大型预训练语言模型生成,用于训练更小、更高效的语言模型。数据集的创建过程利用了预训练模型的生成能力,自动从零开始生成带标签的文本对。STS-Dino主要应用于解决自然语言处理中的语义文本相似性问题,通过提供大量高质量的训练数据,推动了无监督学习方法的发展。

STS-Dino is an automatically generated text similarity dataset developed by the Center for Information and Language Processing (CIS) at Ludwig Maximilian University of Munich (LMU Munich), which requires no manual annotation. The dataset contains 121,275 data samples, generated via large-scale pre-trained language models for training smaller and more efficient language models. The creation process of STS-Dino leverages the generation capabilities of pre-trained models to automatically generate labeled text pairs from scratch. Primarily applied to solve semantic textual similarity problems in natural language processing, STS-Dino promotes the development of unsupervised learning approaches by providing a large volume of high-quality training data.

创建时间:
2021-04-15
搜集汇总
数据集介绍
构建方式
STS-Dino数据集由Schick与Schütze提出,旨在通过预训练语言模型自动生成带标签的文本对,以替代昂贵的人工标注流程。其构建核心为DINO方法:首先利用GPT2-XL等大型语言模型,依据自然语言指令(如“写出两个意思相同的句子”)生成候选句子对,并采用自去偏算法确保生成的句子对仅符合目标相似度标签(完全相同、部分相似或完全不同),同时避免与其他标签契合。数据集包含两种变体——STS-Dino-x2利用已有句子集生成第二个句子,而STS-Dino-x1x2则完全从零生成句子及配对,最终经过去重、标签平滑及随机负采样等处理,形成约12万至14万条训练样本。
特点
STS-Dino的核心特点在于其完全无监督的生成范式,无需任何人工标注或预训练目标调整,即可产出高质量语义相似度训练数据。该数据集通过自去偏机制与多层级相似度标签(0、0.5、1)的精细设计,有效模拟了人类标注者的判断逻辑,尽管生成样本中存在噪声(如同义句对准确率仅47%),但整体仍蕴含充足语义信号。实验表明,基于STS-Dino训练的Sentence-RoBERTa模型在多个语义文本相似度基准上超越现有无监督方法,甚至在某些数据集上匹敌或优于依赖NLI监督的模型,彰显了其数据的高效性与泛化能力。
使用方法
STS-Dino专为训练轻量级句子编码器而设计,推荐结合Sentence-RoBERTa架构使用。使用时需将数据集按90/10划分为训练集与验证集,并采用标签平滑策略(将0和1替换为0.1与0.9)以缓解噪声影响;同时建议为每个输入句子随机采样两个其他句子作为负例(标签0),以增强对比学习信号。训练过程仅需一个epoch,批次大小设为32,模型性能通过验证集上的Spearman秩相关系数早停确定。该数据集已公开于GitHub,可直接加载用于语义相似度任务的微调与评估。
背景与挑战
背景概述
在自然语言处理领域,如何从预训练语言模型中高效获取高质量的句子嵌入一直是一个核心研究问题。传统方法要么通过额外的预训练目标增强模型,要么依赖大规模人工标注的文本对进行微调,后者虽性能更优,但标注成本高昂且耗时。2021年,慕尼黑大学信息与语言处理中心的研究人员Timo Schick与Hinrich Schütze提出了DINO方法,并据此创建了STS-Dino数据集。该数据集完全由预训练语言模型GPT2-XL自动生成,无需任何人工标注,开创性地利用大规模语言模型的生成能力替代人类标注者,为句子相似性任务提供了全新的解决方案。STS-Dino的诞生显著降低了高质量训练数据的获取门槛,在多项语义文本相似性基准测试中,基于该数据集训练的模型甚至超越了依赖数十万人工标注样本的监督方法,对推动无监督句子表示学习具有里程碑意义。
当前挑战
STS-Dino数据集面临的核心挑战源于其全自动生成特性带来的噪声问题。首先,在语义相似性领域,模型需精准区分不同相似度等级,但GPT2-XL生成的句子对存在严重标签偏差:例如,本应语义完全不同的句子对中,约41%仍被人类判断为具有一定相似性;而本该同义的句子对中,仅47%真正符合要求。其次,数据构建过程本身充满技术挑战,包括如何通过自去偏算法确保生成文本仅匹配目标标签而不与其他标签冲突,以及如何处理模型难以生成符合格式要求的文本(如遗漏引号)等问题。此外,为缓解噪声影响,研究者还需采用标签平滑和随机负采样等补偿措施,这些额外步骤增加了方法的复杂性和对超参数的敏感性。
常用场景
经典使用场景
在自然语言处理领域,语义文本相似度(STS)任务致力于衡量句子对之间的语义等价程度,是信息检索、问答系统与文本聚类等应用的核心基石。STS-Dino数据集由Schick和Schütze提出,其独特之处在于完全借助大型预训练语言模型(如GPT-2 XL)的生成能力,通过自然语言指令自动构建标注文本对,从而避免了传统人工标注的高昂成本与规模限制。该数据集以三档相似度标签(相同、部分相似、完全不同)组织样本,特别适用于训练轻量级双编码器模型(如Sentence-RoBERTa),使其在无需任何人工标注数据的前提下,即可在多个标准STS评测集上取得极具竞争力的表现。
解决学术问题
STS-Dino数据集直击了语义文本相似度研究中的两大核心困境:一是高质量标注数据获取成本高昂且规模有限,二是大型预训练模型参数量激增导致微调愈发困难。通过提出DINO方法,该数据集证明了利用语言模型自身生成能力自动合成大规模标注语料的可行性,彻底摆脱了对人工标注的依赖。这一范式革新使得研究者能够在零资源场景下训练出超越此前多数有监督方法的句子嵌入模型,在STS 2012-2016及STSb等基准上刷新了无监督方法的性能上限,为低资源语言、跨领域迁移等场景提供了可复现的解决方案,深刻推动了无监督语义理解的前沿探索。
衍生相关工作
STS-Dino数据集的诞生催生了一系列开创性后续研究。其核心思想——利用语言模型指令生成替代人工标注——被广泛借鉴于数据增强领域,衍生出如基于GPT-3的零样本文本对生成、结合对比学习的自监督句子嵌入等方向。Schick等人后续的工作进一步将DINO与自去偏算法结合,提升了生成样本的标签纯净度。此外,该数据集所验证的“大模型生成、小模型微调”范式,启发了诸如利用T5或LLaMA合成训练数据以优化轻量级检索模型的研究脉络,推动了知识蒸馏与合成数据在NLP任务中的深度融合,成为连接巨型语言模型与实用系统的重要桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务