MetaExe-Bench
收藏资源简介:
MetaExe-Bench是一个大规模元学习基准数据集,由博世人工智能中心等机构联合构建,包含144,177条scikit-learn管道评估记录。该数据集覆盖了2,616种端到端分类和回归管道配置在170个OpenML数据集上的稀疏执行结果,通过整合MLSea-KG和ExeKGs构建统一知识图谱MetaExe-KG。其核心创新在于将数据集元特征与管道配置的结构化表征融合,通过知识图谱嵌入捕捉数据集-管道交互模式。该数据集旨在解决管道性能估计(PPE)和基于性能的数据集相似性评估(DPSE)两大元学习任务,为减少昂贵训练开销提供数据支撑。
MetaExe-Bench is a large-scale meta-learning benchmark dataset jointly constructed by the Bosch Center for Artificial Intelligence and other collaborating institutions, containing 144,177 evaluation records of scikit-learn pipelines. It covers sparse execution results of 2,616 end-to-end classification and regression pipeline configurations across 170 OpenML datasets, and builds a unified knowledge graph named MetaExe-KG by integrating MLSea-KG and ExeKGs. Its core innovation lies in fusing the meta-features of datasets with the structured representations of pipeline configurations, and capturing dataset-pipeline interaction patterns via knowledge graph embedding. This dataset aims to address two core meta-learning tasks: Pipeline Performance Estimation (PPE) and Performance-based Dataset Similarity Evaluation (DPSE), providing data support for reducing expensive training overhead.
数据集概述
数据集基本信息
- 数据集名称:ML Dataset Discovery
- 数据集地址:https://github.com/dtai-kg/KGmetaSP
- 核心目标:探索机器学习数据集的相似性与检索,并预测机器学习流水线性能。
主要组成部分
1. 基于知识图谱嵌入的数据集相似性
- 位置:
kge-based-dataset-similarity文件夹 - 功能:
- 数据准备
- 训练基于 RDF2Vec 的知识图谱嵌入模型
- 计算基于 KGE 的相似度
- 计算图编辑距离
- 使用嵌入预测机器学习流水线性能
- 分析检索评估结果并生成图表
2. 数据集检索评估
- 位置:
dataset-retrieval-evaluations文件夹 - 功能:
- 基于可用数据集上应用的机器学习流水线性能计算真实值
- 为基线方法和基于 KGE 的相似性计算基于排序的指标
- 实现基线方法
3. 流水线特定元模型分析
- 位置:
pipeline-specific-meta-model-analysis文件夹 - 功能:
- 从 OpenML 检索所研究数据集的元特征
- 训练用于性能预测的流水线特定元模型
- 聚合和分析流水线特定元模型评估结果
关键实验结果(链接预测模型用于流水线性能预测)
实验设置
- 模型:TransE, DistMult, ComplEx
- 工具库:PyKEEN
- 配置:
- 训练:自对抗负采样,1500 轮次
- 嵌入维度:128
- 批次大小:2048
- 学习率:0.0005
- 每个正例的负例数:3
- 损失边界:50
场景一:未见数据集
元分类(目标:准确率)
- 最佳方法:KGmetaSP (RDF2Vec)
- 准确率:0.7413
- F1 分数:0.7427
元回归(目标:准确率)
- 最佳方法:配置特定方法
- 均方误差:0.0081
- R² 分数:0.6748
场景二:未见流水线
元分类(目标:准确率)
- 最佳方法:MF All + KGmetaSP (RDF2Vec)
- 准确率:0.8250
- F1 分数:0.8244
元回归(目标:准确率)
- 最佳方法:MF All + KGmetaSP (RDF2Vec)
- 均方误差:0.0070
- R² 分数:0.7361
核心结论
- KGmetaSP (RDF2Vec) 在流水线性能预测任务中实现了最强的基于知识图谱的性能。
- KGmetaSP (LP) 在 KGmetaSP 优于基线的设置中,相比基线方法有所改进。
- 基于游走的嵌入方法(如 RDF2Vec)对于稀疏且结构复杂的知识图谱(如 MetaExe-KG)具有优势。




