Dataset de Similitud entre Escenarios en Español para Ingeniería de Requisitos. Dominio de Cultivo de Tomate
收藏资源简介:
Dataset de 126 pares de escenarios en español del dominio del cultivo de tomate, con etiquetas de similitud semántica anotadas por tres analistas de requisitos. Cada par incluye dos escenarios estructurados siguiendo la notación de Leite et al. (2000), con los campos título, objetivo, contexto, recursos, actores y episodios. La etiqueta de similitud (true_label) es el promedio de las evaluaciones de tres anotadores en una escala de 1 a 5, donde 1 indica que los escenarios no son equivalentes aunque pertenecen al mismo dominio, y 5 indica que son equivalentes. El acuerdo entre anotadores fue evaluado con el coeficiente de Krippendorff, obteniendo un valor de 0.854. El dataset fue construido para evaluar estrategias de detección temprana de escenarios duplicados en ingeniería de requisitos mediante similitud semántica.
本数据集包含126组西班牙语番茄种植领域场景对,其语义相似度标签由三名需求分析师标注完成。每组场景对均包含两个遵循Leite等人2000年提出的标注规范构建的结构化场景,涵盖标题、目标、背景、资源、角色与事件六大字段。相似度标签(true_label)为三名标注者评分的平均值,评分区间为1至5分:1分代表两个场景虽同属该领域但并不等价,5分则代表二者完全等价。标注者间的一致性通过克里彭多夫系数(Krippendorff coefficient)进行评估,最终得分为0.854。本数据集旨在通过语义相似度技术,评估需求工程领域中场景重复项的早期检测策略。



