遇见数据集

Corpus FAIR-DO para evaluación de generación de código con LLMs (50 tareas)

收藏
Zenodo2026-07-06 更新2026-08-01 收录
官方服务:

资源简介:

Corpus experimental de un Trabajo Fin de Master que evalua si los modelos de lenguaje (LLMs) generan mejor codigo en tareas cientificas cotidianas cuando los datos de contexto se entregan encapsulados como FAIR Digital Objects (FDO), con el estandar RO-Crate 1.1, frente a entregarlos como datos en crudo (DO). Contiene 50 tareas de transformacion de datos habituales (agregaciones, joins, filtrado, ranking, remodelado, estadistica, series temporales, ingenieria de variables, normalizacion, codificacion y conversiones de formato) repartidas en unos 20 dominios y 33 categorias, para evitar sesgos hacia un unico tipo de tarea. Todos los datos son reales y referenciados (no sinteticos), procedentes de fuentes publicas citadas (NOAA, World Bank, scikit-learn/UCI, statsmodels, seaborn-data, vega-datasets, entre otras). Por cada tarea se incluyen los datos de entrada y de salida esperada en crudo (DO) y su encapsulado como RO-Crate de entrada y de salida (FDO) con metadatos FAIR (identificador persistente, licencia, descripcion, variables, formato y procedencia). Se incluyen ademas el catalogo maestro, el codigo generado por los modelos, los resultados, las tablas y las figuras. El corpus se genera de forma reproducible (semilla fija) y el resultado esperado de cada tarea se ha verificado de forma independiente (50/50 correctas). Licencia: CC-BY-4.0; los subconjuntos proceden de fuentes publicas y se redistribuyen con atribucion bajo sus licencias originales.

提供机构:
Zenodo
创建时间:
2026-07-06
二维码
社区交流群
二维码
科研交流群
商业服务