kurbanintelligencelab/RADII
收藏官方服务:
资源简介:
RADII是一个基于半径解析的纳米颗粒结构基准数据集,用于测量图生成模型随着生成结构增大而开始失效的程度。半径被视为从分布内到分布外的连续缩放参数;数据集覆盖10种材料和25个半径,具有无泄漏分割。
RADII measures where graph generative models start to fail as the structures they generate grow larger. Radius is treated as a continuous scaling knob from in-distribution to out-of-distribution; the dataset spans 10 materials and 25 radii with leakage-free splits.
搜集汇总
数据集介绍

构建方式
RADII数据集是一个专为评估图生成模型在纳米颗粒结构生成中的外推能力而设计的基准数据集。其构建核心在于将半径作为连续缩放旋钮,系统性地生成从分布内到分布外的结构样本。数据集涵盖10种材料(如Ag、Au、MoS₂等)和25个截断半径值,通过无泄漏的分割策略划分为训练集(48000个样本,15个半径值)、分布内测试集(13500个样本,6个插值半径)和分布外测试集(13480个样本,4个严格位于训练范围外的半径),确保模型无法从训练数据中直接记忆未见半径的结构特征。
特点
RADII数据集的显著特点在于其独特的分布外评估设计,能够量化图生成模型在结构规模增大时的性能退化边界。每个数据样本包含完整的原子坐标、原子序数、晶格向量等结构化信息,并通过半径、材料和旋转索引等元数据列实现灵活的分组与切片。分布外测试集中的结构原子数量范围(33–11298)显著超出训练集(81–9148),分别缩小约59%和扩大约24%,为评估模型外推能力提供了严格的挑战性场景。
使用方法
该数据集可通过HuggingFace Datasets库直接加载,无需额外下载或注册。用户可使用`load_dataset`函数获取指定分割的数据,并利用`filter`和`unique`方法按半径、材料等元数据进行细粒度筛选与分析。对于PyTorch用户,提供了自定义的collate函数以处理变长的原子坐标和原子序数序列,并兼容PyTorch Geometric的数据格式。此外,数据集附带的五个基线模型(如ADiT、CDVAE)均已集成HuggingFace模型接口,支持保存、加载和微调操作。
背景与挑战
背景概述
RADII数据集由KurbanIntelligenceLab团队于2026年创建,旨在评估图生成模型在材料科学中纳米颗粒结构生成任务上的外推能力。该数据集围绕半径作为连续缩放旋钮的核心设计理念,涵盖了10种材料与25种截断半径,构建了从分布内到分布外的系统性基准。通过提供无泄漏的划分策略,RADII为研究模型在结构复杂度递增时的性能退化提供了标准化平台。其相关论文发表于KDD '26,深刻揭示了图生成模型在大规模材料结构生成中的局限性,对材料信息学与生成式人工智能交叉领域产生了重要的推动作用。
当前挑战
RADII所解决的核心领域挑战在于图生成模型在材料结构生成中面临的外推瓶颈——随着纳米颗粒尺寸增大,模型生成结构的保真度与稳定性显著下降,而现有数据集缺乏对尺寸缩放影响的系统评估。其构建过程中,挑战在于确保不同半径下结构的真实物理一致性,包括精确的原子坐标、晶格矩阵与原子类型记录,同时实现严格的无泄漏划分以避免数据重叠。特别地,OOD测试集的极端半径(6–7 Å与29–30 Å)导致原子数目与训练集存在显著偏差(33–11,298 vs 81–9,148),增加了模型在未见尺度下泛化能力的评估难度。
常用场景
经典使用场景
RADII数据集专为评估图生成模型在材料科学中的外推能力而设计,其核心使用场景是作为结构外推基准测试。通过将截断半径作为连续缩放旋钮,该数据集涵盖了10种材料(如Ag、Au、TiO₂等)在25种半径下的纳米颗粒结构,并精心划分了训练集(15种半径)、内插测试集(6种半径)与外推测试集(4种半径)。研究者可借此系统性地考察模型从分布内到分布外的生成表现,尤其关注原子数量跨度从33到11,298的极端外推情况,为图生成模型的泛化边界提供量化度量。
解决学术问题
该数据集解决的核心学术问题是图生成模型在材料结构外推任务中的失效边界表征问题。先前研究多聚焦于分布内生成质量,而RADII通过连续调控结构半径,首次系统性地量化了模型在更小或更大结构上的外推退化程度。其泄露自由的分割设计确保了OOD测试中的59%缩小与24%放大结构无法从训练集中推断,从而为“模型能否真正学习到物理尺度规律”这一根本性问题提供了严谨的评估工具。该工作开创了材料科学中生成模型外推性的标准化评估范式,影响深远。
衍生相关工作
RADII数据集衍生了一系列关键工作。其核心论文《How Far Can You Grow?》于KDD '26发表,并配套提供了五个基线模型(ADiT、CDVAE、DiffCSP、FlowMM、MatterGen)的标准化接口,形成了从模型训练到评价的完整工具链。此外,数据集设计中的“外推边界”概念已催生多项后续研究,包括针对不同材料体系的外推规律探索、以及结合物理约束的生成模型改进。其泄露自由的分割策略与半径连续调控制度,亦被后续基准测试数据集借鉴,成为评估材料科学生成模型的行业标准。
以上内容由遇见数据集搜集并总结生成




