YieldShift
收藏资源简介:
YieldShift是一个来自显示制造设施的真实生产线数据,作为公共基准数据集,用于评估表格机器学习在真实分布偏移下的性能。数据集包含约19,000行和226列(223个特征),支持连续缺陷率回归和二进制缺陷分类任务,其中缺陷类别占多数(74.7%)。特征包括173个数值特征和50个分类特征,已进行匿名化处理。
YieldShift is a real production line dataset from a display manufacturing facility, serving as a public benchmark for evaluating tabular machine learning performance under real-world distribution shifts. The dataset comprises approximately 19,000 rows and 226 columns (223 features), supporting two tasks: continuous defect rate regression and binary defect classification, with the defect class being the majority class (74.7% of samples). The features include 173 numerical features and 50 categorical features, all of which have been anonymized.
数据集概述:YieldShift
YieldShift 是一个来自显示制造业真实生产线的表格数据集,旨在作为评估机器学习模型在真实分布偏移下性能的公开基准。
- 核心任务:数据集支持在同一 223 个特征(173 个数值型
num_*,50 个类别型cat_*)上完成两项任务:连续缺陷率回归(目标变量y)和二元缺陷分类(y > 0)。其中,缺陷类为多数类,占比 74.7%。 - 数据规模:数据集文件
data.parquet包含约 19,000 行、226 列。所有数值特征经过最小-最大缩放以匿名化,且无数据行被添加、删除或重采样。 - 特征详情:
- 数值特征(
num_*):173 个,缺失率范围为 0-99.3%,平均缺失率为 45%。 - 类别特征(
cat_*):50 个,无缺失值。中位基数为 3,49/50 列的基数<=6,一个异常值列(cat_049)基数为 1,080。 - 时间戳特征:
x_time(特征采集时间)和y_time(标签确认时间),无缺失值,但不作为建模特征。 - 目标变量
y:连续缺陷率,缩放至 [0,1] 区间,无缺失值。
- 数值特征(
- 评估框架:采用配对、5 次重复的评估协议,在两种划分下对 19 个模型进行基准测试:普通随机划分和一组展现真实协变量/概念/标签偏移的领域。
- 模型家族(19 个模型):
- 基于树:RandomForest, LightGBM, XGBoost, CatBoost
- 线性模型:LinearRegression(无正则化), LinearModel(Ridge / ℓ2-LogReg)
- 非注意力深度学习:MLP, ResNet, RealMLP, MLP_PLR, NODE, TabM
- 基于注意力模型:FT_Transformer, TabTransformer, SAINT, TabNet
- 基础模型:TabPFN v3, TabICL v2, TabFM v1.0
- 关键发现:在所有 19 个模型和 7 个回归领域上,从分布内(ID)到分布外(OOD)的回归 R² 均出现下降(平均从 0.577 降至 0.235),而分类平衡准确率几乎不变(平均下降 0.011,且 27% 的单元显示 OOD 性能不低于 ID)。模型的独立同分布排名并不能可靠预测其在分布偏移下的排名。
- 使用许可:
- 代码:MIT 许可。
- 数据集(
data.parquet和results/):CC BY 4.0 许可。





