Índice de Fallos IA . Snapshot 2026-05
收藏资源简介:
Este dataset representa el snapshot mensual del Índice de Fallos IA, producido por el observatorio LaAutopsIA. Proporciona una medición técnica y auditable de la fiabilidad de los principales Modelos de Lenguaje de Gran Tamaño (LLMs) durante mayo de 2026. Metodología y Fuentes La información se consolida a partir de benchmarks independientes líderes en la industria: Vectara: Evaluación de alucinaciones y veracidad. BFCL (Berkeley Function Calling Leaderboard): Precisión en la ejecución de funciones y lógica. LMSYS: Rendimiento comparado y preferencias técnicas. Contenido y Estructura El dataset se entrega en formatos JSON y CSV para facilitar su integración en pipelines de datos y herramientas de análisis. Utiliza una taxonomía cerrada que garantiza la trazabilidad punto a punto de cada métrica de error, eliminando sesgos comerciales y centrándose en la seguridad y robustez de los modelos. Propósito Documentar de forma histórica y auditable la evolución de la fiabilidad de la IA generativa, sirviendo como recurso crítico para desarrolladores, auditores de sistemas y expertos en seguridad que buscan datos crudos sobre la tasa de fallo real de los modelos actuales.



