Dataset de Similitud entre Escenarios en Español para Ingeniería de Requisitos. Dominio de Cultivo de Tomate
收藏资源简介:
Dataset de 126 pares de escenarios en español del dominio del cultivo de tomate, con etiquetas de similitud semántica anotadas por tres analistas de requisitos. Cada par incluye dos escenarios estructurados siguiendo la notación de Leite et al. (2000), con los campos título, objetivo, contexto, recursos, actores y episodios. La etiqueta de similitud (true_label) es el promedio de las evaluaciones de tres anotadores en una escala de 1 a 5, donde 1 indica que los escenarios no son equivalentes aunque pertenecen al mismo dominio, y 5 indica que son equivalentes. El acuerdo entre anotadores fue evaluado con el coeficiente de Krippendorff, obteniendo un valor de 0.854. El dataset fue construido para evaluar estrategias de detección temprana de escenarios duplicados en ingeniería de requisitos mediante similitud semántica.



