遇见数据集

CSE472-blanket-challenge/SCM3K

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

SCM3K是一个基准数据集,用于评估表格预测中马尔可夫边界的特征选择和预测性能。数据集包含从随机结构因果模型(SCMs)中采样的3,450个表格预测任务,总计345万条记录(每个任务1,000个样本)。每个任务提供了目标节点的真实马尔可夫边界,允许在已知因果结构下评估特征选择和预测。数据集按特征数量分为九个级别(从40到1,000个特征),每个级别对应不同的节点数、DAG密度和马尔可夫边界比例范围。数据生成基于Erdos-Renyi DAGs和六种SCM家族(如线性高斯和非高斯模型),确保了多样性和真实性。数据集适用于机器学习研究,特别是因果推断和特征选择领域。

SCM3K is a benchmark dataset for evaluating feature selection and prediction performance of Markov boundaries in tabular prediction. It consists of 3,450 tabular prediction tasks sampled from random structural causal models (SCMs), totaling 3.45 million records (1,000 samples per task). Each task includes the ground-truth Markov boundary of the target node, enabling evaluation of feature selection and prediction under known causal structure. The dataset is divided into nine feature-count levels ranging from 40 to 1,000, each with varying numbers of nodes, DAG densities, and Markov boundary ratio bands. Data generation uses Erdos-Renyi DAGs and six SCM families (e.g., linear Gaussian and non-Gaussian models), ensuring diversity and realism. The dataset is suitable for machine learning research, particularly in causal inference and feature selection domains.

搜集汇总
数据集介绍
构建方式
SCM3K数据集基于随机结构因果模型(SCM)构建,旨在为马尔可夫边界发现与表格预测研究提供标准化基准。数据生成流程分为两步:首先采用Erdos-Renyi随机图模型生成有向无环图(DAG),每个节点数与密度组合对应5个独立图结构;随后为每个DAG赋予6类SCM参数化实例,涵盖线性高斯、线性非高斯、非线性加性噪声高斯与非高斯、后非线性及异方差模型。每项任务固定采样1000个样本,并严格记录目标节点的马尔可夫边界真值,形成涵盖40至1000维度共9个特征规模层级、总计3450个任务的完整集合。
使用方法
SCM3K可通过HuggingFace Datasets库便捷加载。用户根据所需特征维度访问对应数据分片,如load_dataset('CSE472-blanket-challenge/SCM3K', split='f200')即可获取200维特征的全部任务。每个样本可直接索引获取特征张量X(1000×F)、目标向量y及马尔可夫边界掩码mb_mask。数据集未预设训练/测试划分,推荐采用HuggingFace的切片语法自定义分割,如split='f400[:80%]'。此外,用户可进一步利用dag、scm与target结构体中的因果信息,开展马尔可夫边界发现、因果特征选择及因果感知预测等多样化实验分析。
背景与挑战
背景概述
在因果推断与特征选择领域,马尔可夫边界(Markov boundary)作为目标变量的最优特征子集,其理论价值与实用潜力早已得到广泛认可。然而,现有基准数据集多专注于低维或特定因果结构下的评估,缺乏对高维、多样因果图场景的系统性覆盖。为此,亚利桑那州立大学Shu Wan、Abhinav Gorantla、Huan Liu与K. Selçuk Candan等研究人员于2026年共同构建了SCM3K数据集。该数据集基于随机结构因果模型(SCMs)生成,包含3,450个表格预测任务,涵盖从40至1,000个特征的九个维度层级,并提供每个任务中目标节点的真实马尔可夫边界标签。SCM3K的发布为因果发现与特征选择算法的评估提供了规模更大、背景更全面的标准化平台,有力推动了该领域实证研究的深入发展。
当前挑战
SCM3K所解决的核心领域挑战源于高维表格预测任务中马尔可夫边界识别的不确定性:当特征空间扩展至数百乃至上千维度时,传统特征选择方法易受冗余变量干扰,难以精确辨识因果结构中的核心变量集。同时,构建这一大规模基准面临多重技术难题——需确保生成的DAG(如Erdos-Renyi图)在密度与节点数上具有广泛代表性,并维系因果机制的可控性与可重复性;还需针对不同SCM族(如线性高斯、非线性加性噪声等)参数化生成数据,使其兼具现实复杂性与理论完备性。此外,数据集需避免预定义划分带来的偏差,故采用Hugging Face切片语法以支持灵活的实验设计,这也进一步增加了构建流程中质量控制与规模扩展的难度。
常用场景
经典使用场景
在因果发现与特征选择的研究版图中,SCM3K数据集为评估马尔可夫边界(Markov Boundary)算法的鲁棒性与精确性提供了标准化的测试场。该数据集包含3,450个源自结构化因果模型(SCM)的表格预测任务,每个任务都配有真实马尔可夫边界掩码,使得研究者可以精准衡量算法在已知因果结构下的特征选择表现。从40维到1000维的九个特征规模层级,覆盖了稀疏到密集的不同拓扑密度,尤其适合验证算法在特征维度变化时的泛化能力。经典使用方式是利用其提供的特征矩阵X与目标变量y,结合真实MB掩码,比较各类因果特征选择方法在恢复马尔可夫边界时的查准率与查全率,从而在受控环境中揭示算法的内在优势与局限。
解决学术问题
该数据集精准回应了表格预测中一个长期悬而未决的学术困境:如何在真实因果结构未知的情境下,公正地评估不同马尔可夫边界学习方法的优劣。传统基准数据集往往缺失因果图真相,导致研究者只能依赖代理指标如预测精度间接推断特征选择质量。SCM3K通过提供完整的DAG拓扑、结构方程参数以及每个目标节点的父节点、子节点与配偶节点掩码,使得因果结构已知条件下的系统性对比成为可能。它直接推动了关于马尔可夫边界充分性、稳健性及与下游预测任务关联性的理论讨论,为揭示哪些边界特征对预测真正不可或缺提供了量化的实验基础。其意义在于将因果特征选择研究从方法论创新推进到可复现、可比较的实证科学阶段,对理解因果机制与预测性能之间的张力产生了深远影响。
实际应用
在工业界的高维表格数据建模场景中,SCM3K所开创的评估范式具有直接的实践价值。金融风控中,信用评分模型的输入变量常包含冗余与混杂因子,通过马尔可夫边界算法筛选出的变量子集可构建更简洁且稳健的预测模型,降低过拟合风险并提升模型可解释性。医疗诊断领域,从电子健康记录中提取关键生物标志物时,依据因果结构而非仅凭相关性进行特征选择,能有效识别疾病的直接驱动因素,有助于构建可解释的临床决策支持系统。电商推荐系统中,面对稀疏且高维的用户行为数据,利用马尔可夫边界压缩特征空间可显著提升在线推理效率,同时保持预测准确率。该数据集验证的方法论为构建因果驱动的预测模型铺设了从理论验证到工程落地的桥梁。
数据集最近研究
最新研究方向
在因果推断与表格数据预测的前沿交叉地带,SCM3K数据集为马尔可夫边界的系统性评估提供了关键基准。当前研究聚焦于揭示高维特征空间中因果结构与预测性能之间的微妙张力——通过跨越40至1000个特征的九个难度层级,该数据集支持对特征选择算法在已知因果图下的鲁棒性进行细粒度剖析。其随机结构因果模型的生成范式,特别是对线性/非线性、高斯/非高斯噪声及异方差场景的全面覆盖,使得研究者能够深入考察马尔可夫边界在复杂预测任务中的“好、坏、丑”三重面相。与Erdos-Renyi随机图结合六类SCM家族的实验设计,不仅呼应了因果发现领域对可控基准的迫切需求,更推动了从纯粹统计关联向因果驱动特征表征的范式转型,为可解释人工智能在医疗诊断、金融风控等高风险场景中的可信部署奠定了方法论基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务