Benchmark reproducible de desarrollo web con GPT-5.6 Sol — v1.0.2-r2
收藏资源简介:
Conjunto de datos, evidencia y código de reproducción de una evaluación limitada de desarrollo web realizada el 17 de agosto de 2026. Incluye tres solicitudes independientes con el mismo prompt, imagen y configuración congelados, respuestas públicas proyectadas, candidatos, resultados por regla, capturas, manifiestos y checksums. La interpretación corregida v1.0.2 obtuvo 3/3 salidas aceptadas y 108/108 reglas aprobadas. El resultado histórico 0/3 de v1.0.0 se conserva por transparencia, pero quedó invalidado por defectos del evaluador y no debe citarse como rendimiento del modelo. v1.0.2 es una corrección posterior a la ejecución, sin nuevas llamadas a la API ni cambios en las respuestas, candidatos o evidencia originales. La prueba cubre un único componente ficticio, tres repeticiones y Chromium; no demuestra superioridad general, conformidad WCAG ni seguridad de producción. El archivo START-HERE.md explica qué resultados deben citarse. El código se distribuye bajo MIT; los prompts, fixtures, evidencia, resultados e imágenes bajo CC BY 4.0. El paquete compuesto v1.0.2-r2 conserva la capa histórica v1.0.0 para auditoría.



