Índice de Fallos IA - Snapshot 2026-08
收藏资源简介:
Este dataset representa el snapshot mensual del Índice de Fallos IA, producido por el observatorio La AutopsIA. Proporciona una medición técnica y auditable de la fiabilidad de los principales Modelos de Lenguaje de Gran Tamaño (LLMs) durante agosto de 2026. Metodología y Fuentes La información se consolida a partir de benchmarks independientes líderes en la industria: Vectara: evaluación de alucinaciones y veracidad. BFCL (Berkeley Function Calling Leaderboard): precisión en la ejecución de funciones y lógica. LMSYS Arena: rendimiento comparado y preferencias técnicas mediante votaciones a ciegas de usuarios reales. Contenido y Estructura El dataset se entrega en formatos JSON y CSV para facilitar su integración en pipelines de datos y herramientas de análisis. Utiliza una taxonomía cerrada que garantiza la trazabilidad punto a punto de cada métrica, eliminando sesgos comerciales y centrándose en la seguridad y robustez de los modelos. Propósito Documentar de forma histórica y auditable la evolución de la fiabilidad de la IA generativa, sirviendo como recurso crítico para desarrolladores, auditores de sistemas, organismos reguladores y expertos en seguridad que buscan datos crudos sobre la tasa de fallo real de los modelos actuales. Limitaciones y sesgos conocidos Cobertura no exhaustiva: el snapshot refleja solo los modelos LLM presentes en las fuentes activas (Vectara, BFCL, LMSYS) al cierre del mes. Modelos sin evaluación pública en estas fuentes no aparecen. Sesgos heredados de la metodología original: cada fuente mide aspectos distintos. Vectara mide alucinación con prompts fijos; BFCL evalúa function calling sintético; LMSYS depende de votaciones humanas. Estos sesgos se heredan en el dataset y no se intentan corregir. Sesgo de mercado y idioma: las fuentes tienden a cubrir mejor modelos comerciales en inglés que modelos en otros idiomas o procedentes de investigación académica menos visible. Ventana temporal: hay desfases naturales entre measuredAt (origen) y fetchedAt (captura), de horas o días. Datos faltantes: si la fuente no aporta un campo, la celda CSV queda vacía y la clave JSON se omite. El ranking depende de los modelos disponibles ese mes: comparar entre meses requiere alinear por modelVariant, no por rank. Usos no recomendados Toma de decisiones clínicas, legales o financieras basadas directamente en el ranking. El dataset mide aspectos específicos, no aptitud general para tareas reguladas. Training de modelos. Es dataset de evaluación, no de entrenamiento. Para qué sirve este dataset Equipos de producto eligiendo qué LLM integrar: comparar tasa de alucinación, precisión en function calling y rating Elo entre candidatos con datos verificables, no marketing del proveedor. Investigación académica sobre evolución temporal de la fiabilidad LLM: snapshots mensuales encadenados permiten estudios longitudinales con cita por DOI. Periodismo técnico y divulgación: cifras citables con DOI permanente, no leaderboards efímeros. Auditoría y compliance: trazabilidad fila a fila (sourceUrl, sourceLicense, methodology, measuredAt, fetchedAt) para reconstruir cualquier medición hasta su fuente. Reguladores evaluando criterios objetivos sobre fiabilidad de sistemas IA generativa. Mantenimiento y contacto Frecuencia: snapshot mensual, día 3 a las 09:00 UTC. Mantenedor: ApisDom Intelligence Group - apisdom.com. Observatorio: laautopsia.com. Contacto del dataset: dataset@apisdom.com. Contacto editorial: noticias-autopsia@apisdom.com.



