遇见数据集

Benchmark reproducible de desarrollo web con GPT-5.6 Sol — v1.0.2-r2

收藏
Zenodo2026-08-17 更新2026-08-20 收录
官方服务:

资源简介:

Conjunto de datos, evidencia y código de reproducción de una evaluación limitada de desarrollo web realizada el 17 de agosto de 2026. Incluye tres solicitudes independientes con el mismo prompt, imagen y configuración congelados, respuestas públicas proyectadas, candidatos, resultados por regla, capturas, manifiestos y checksums. La interpretación corregida v1.0.2 obtuvo 3/3 salidas aceptadas y 108/108 reglas aprobadas. El resultado histórico 0/3 de v1.0.0 se conserva por transparencia, pero quedó invalidado por defectos del evaluador y no debe citarse como rendimiento del modelo. v1.0.2 es una corrección posterior a la ejecución, sin nuevas llamadas a la API ni cambios en las respuestas, candidatos o evidencia originales. La prueba cubre un único componente ficticio, tres repeticiones y Chromium; no demuestra superioridad general, conformidad WCAG ni seguridad de producción. El archivo START-HERE.md explica qué resultados deben citarse. El código se distribuye bajo MIT; los prompts, fixtures, evidencia, resultados e imágenes bajo CC BY 4.0. El paquete compuesto v1.0.2-r2 conserva la capa histórica v1.0.0 para auditoría.

提供机构:
Zenodo
创建时间:
2026-08-17
二维码
社区交流群
二维码
科研交流群
商业服务