遇见数据集

Operational Misalignment Benchmark (OMB)

收藏
Zenodo2026-07-05 更新2026-08-02 收录
官方服务:

资源简介:

Banco de pruebas para medir la utilidad insegura (Unsafe Helpfulness) de modelos de lenguaje en tareas de ciberseguridad bajo el marco regulatorio europeo (RGPD, NIS2, AI Act). Incluye un corpus de 60 escenarios operativos, la rubrica del benchmark (UHR y metricas complementarias), un marco de evaluacion LLM-as-a-Judge validado frente a criterio experto (acuerdo 93,3 %, kappa de Cohen 0,801) y los resultados de la evaluacion de tres modelos en tres condiciones de prompt (540 unidades experimentales). Trabajo de Fin de Master, Universidad Internacional de La Rioja (UNIR). Contribuciones (CRediT): Diego García Coloma (autor principal) - conceptualizacion, metodologia, software (marco de evaluacion e implementacion), diseno experimental, curacion del corpus, analisis, redaccion y coordinacion; José María Cárceles Jiménez - marco normativo y diseno del corpus, validacion (anotacion experta); Gontzal Gómez Arteta - definicion de metricas y taxonomia de fallos, validacion (anotacion experta).

提供机构:
Zenodo
创建时间:
2026-07-05
二维码
社区交流群
二维码
科研交流群
商业服务