遇见数据集

31. DATASET COMPLETO DE EVALUACIONES CRUZADAS RFC-EVAL-001 – 6 SISTEMAS DE IA (ENERO 2026).

收藏
Zenodo2026-02-17 更新2026-05-26 收录
官方服务:

资源简介:

Dataset completo de evaluaciones cruzadas RFC-EVAL-001 – 6 sistemas de IA (enero 2026) Este dataset contiene las 36 evaluaciones cruzadas completas realizadas en enero de 2026 entre seis sistemas de IA comerciales de última generación, identificados como IA1-IA6 en el dataset anonimizado. Cada sistema evaluó a los otros cinco y a sí mismo en cuatro dimensiones cognitivas: Complejidad del Modelo (Cm), Horizonte Temporal (Ht), Meta-Modelado (Mm) y Flexibilidad Adaptativa (Fa), utilizando el protocolo estandarizado RFC-EVAL-001 v1.1. ESTRUCTURA DEL ARCHIVO EXCEL: Hoja 1 - Dataset_completo:Las 36 evaluaciones con puntuaciones en escala 0-1 para cada dimensión, cálculo de Gamma (γ) por evaluación, y marcas temporales. Formato: evaluado, evaluador, Cm, Ht, Mm, Fa, gamma, timestamp. Hoja 2 - Matriz_Gamma:Matriz 6×6 con valores γ por par evaluador-evaluado (diagonal = autoevaluaciones). Hoja 3 - Medias_por_sistema:Resumen por sistema con medias netas de cada dimensión (excluyendo autoevaluación), Gamma neto, clasificación NOVA, sesgo de autoevaluación y fortaleza principal. Hoja 4 - Tests_Rubricas:Especificaciones completas de los tests para cada dimensión, incluyendo prompts exactos, criterios de evaluación y rúbricas de puntuación (0-1 con descriptores por nivel). Hoja 5 - Plantilla_Evaluacion_Fa:Plantilla detallada para la evaluación de Flexibilidad Adaptativa (Fa), con desglose de componentes, pesos, criterios específicos y puntuaciones máximas. Hoja 6 - Protocolo_Ejecucion:Plan de ejecución de 2 semanas con tareas diarias, duración estimada y responsables. Hoja 7 - Plantilla_Resultados:Formato estándar para reportar hallazgos, incluyendo metadatos, tablas de resultados, análisis de fiabilidad (ICC), ranking de creatividad y limitaciones. Este dataset es el original verificado y corregido, y constituye la base de los análisis presentados en el Documento 30 (technical report) y el Documento 31 (manuscrito asociado). Las rúbricas y plantillas de evaluación incluidas permiten la replicación exacta del estudio y garantizan la transparencia metodológica completa. LICENCIA:Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0) PALABRAS CLAVE:AI evaluation, cognitive profiling, large language models, inter-rater reliability, RFC-EVAL-001, benchmark dataset, rubrics, evaluation protocol

提供机构:
Zenodo
创建时间:
2026-02-17
二维码
社区交流群
二维码
科研交流群
商业服务