遇见数据集

Unified AD Planning Dataset

收藏
github2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

统一自动微分规划数据集,包含顶点消元和广义规划两个通道,提供程序化图和真实图实例,用于自动微分规划问题的组合优化基准测试。

Unified Automatic Differentiation Planning Dataset consists of two tracks: vertex elimination and generalized planning, and provides synthetic graph and real-world graph instances for combinatorial optimization benchmarking of automatic differentiation planning problems.

创建时间:
2026-08-25
原始信息汇总

数据集概述

Unified AD Planning Dataset(统一自动微分规划数据集) 是一个用于自动微分(AD)规划组合优化问题的冻结双语公开基准。该问题要求为模块化计算图选择一条低成本的局部导数运算序列(预累积局部 Jacobian、tangent/adjoint 传播、显式矩阵乘法与顶点消元),使其复合结果等于整个程序的精确 Jacobian。求最优计划是 NP-hard 的。

本数据集的核心用途是支持自动启发式设计(AHD):任何 AHD 方法(如 EoH、FunSearch、ReEvo)都可以利用该基准发现紧凑的 score_actions 打分程序,并在统一协议下公平比较。

数据组织与规模

所有数据位于 data/unified_ad_planning/ 目录下,按 train / validation / test 划分:

划分 顶点消元通道 广义规划通道 合计
train 4,096 张(AlphaGrad 程序化图,HDF5 分桶) 1,024 张(确定性合成模块图,GraphML + JSONL) 5,120
validation 1,024 张 256 张 1,280
test 56 张(CrosscountryAD 真实图,JSON from DOT) 8 张(ADMission 官方示例:bat、lion、newton_1/2/10、openfoam、openfoam_1/2) 64
  • 顶点消元通道的图仅暴露 VERTEX_ELIM 宏动作,启发式只决定消元顺序。
  • 广义规划通道使用五个动作(ACC_TAN / ACC_ADJ / ELI_TAN / ELI_ADJ / ELI_MUL),联合决定局部 Jacobian 是否物化、传播方向与显式相乘时机。
  • 数据文件只保存初始模块 DAG,中间状态由环境在线产生,不固化任何特定策略的 rollout。
  • train 与 validation 种子区间完全分离,5,120 + 1,280 张图按拓扑与内容全局去重;同一拓扑的不同成本配置保持在同一 split,避免泄漏。

程序契约

AHD 方法只允许改写 score_actions 的函数体,环境负责枚举合法动作与特征,固定的 argmin 选择得分最低的合法动作,固定的 step 执行精确状态转移。核心约束包括:

  • 函数名与参数名不可更改(共 32 个状态参数 + 5 个 per-action 参数);环境以关键字参数调用。
  • 返回必须是形状 [A] 的有限数组,非法动作通过 valid_mask 置为 +inf
  • 必须是纯函数,与顶点重标号无关,且不依赖固定图规模或训练图编号。
  • 成本为非负 int64 累计成本,越小越好;环境通过结构精确性检查与确定性非交换矩阵指纹保证计划的精确性,不执行数值 Jacobian。
  • 评估流程固定为 reset → features → argmin → step → exactness,AHD 不可修改。

环境与依赖

  • 审计环境为 Python 3.10.19、NumPy 1.26.4、JAX 0.4.38(CUDA)。
  • 仅读取数据集只需 numpyh5py;五动作环境为纯 Python + NumPy/JAX(C++ ADMission 不是运行依赖);顶点评估器需额外依赖上游 AlphaGrad 仓库(精确提交记录在 sources.lock.json)。
  • 内置 AHD 评估器按家族等权聚合归一化成本(候选成本 / 参照基线),越小越好。

基线与评分

  • 所有 1,280 张广义图的逐图参照成本见 baselines/generalized_admission_1024_256_baselines.csv
  • 顶点通道 train(4,096)与 validation(1,024)的归一化基准(degree-product reference)分别对应两个 JSONL 文件。
  • 手工 AD 基线(Forward、Reverse、Markowitz、MR、M2D、DMC、PL、PC、ER、MD、MiddleOut、Simulated Annealing、AlphaGrad PPO/AlphaZero)与 AHD 基线(EoH、FunSearch、ReEvo、随机采样、hill climbing)的规范见 baseline_matrix.md

使用划分与允许用途

  • train:仅用于启发式发现。
  • validation:仅用于最终程序选择,不反馈给搜索。
  • test(56 张 CrosscountryAD):冻结,仅最终评估。
  • test(8 张 ADMission 官方示例):仅允许格式转换、单元测试、基线复刻与小图 oracle,禁止用于发现或选择。

许可与来源

  • 上游来源(AlphaGrad、CrosscountryAD、ADMission)的提交、论文链接与角色固定在 sources.lock.json,第三方许可证文本在 licenses/ 目录。
  • 项目代码采用 MIT 许可;论文 PDF 不随包分发。
  • 完整双语数据说明位于 data/unified_ad_planning/DATASET.zh-CN.mdDATASET.en.md

引用方式

使用本数据集需引用配套论文。数据集 BibTeX 引用信息:@misc{unified_ad_planning_2026, title = {Unified AD Planning Dataset}, year = {2026}, note = {Version 0.2, released 2026-08-25} }。上游来源请按其各自许可证分别引用。

搜集汇总
数据集介绍
Unified AD Planning Dataset 数据集图片
构建方式
ADPlanBench数据集的构建旨在攻克自动微分规划问题,其核心在于寻求计算相同Jacobian矩阵的最优操作序列。该数据集精心设计了两条赛道:顶点消元赛道与广义AD规划赛道。顶点消元赛道基于AlphaGrad程序化生成4096个训练图及1024个验证图,存储于分桶HDF5文件中;广义AD规划赛道则通过确定性合成模块图,构建了1024个训练图与256个验证图,以GraphML与JSONL格式存储。测试集采用56个来自CrosscountryAD的真实图,并额外提供了8个ADMission官方示例作为公开诊断样本。所有数据均经过全局去重,确保不同拓扑与成本配置的图合理分布在各个分割中,避免信息泄露。
特点
该数据集的核心特点在于其统一的动作打分接口与固定的评估协议,使得各类方法——启发式、学习式、搜索式或程序合成——均可通过生成打分函数无缝接入。数据集精心设计了五类动作(ACC_TAN、ACC_ADJ、ELI_TAN、ELI_ADJ、ELI_MUL),联合决定局部Jacobian的物化、传播方向及显式相乘的时机,并提供了细粒度的动作特征,为策略学习提供了丰富信息。同时,内置的精确性检验通过结构验证与确定性非交换矩阵指纹技术,确保生成的计划在数学上精确无误,而无需执行数值Jacobian计算,这一设计既保证了严谨性又提升了评估效率。
使用方法
参与者仅需实现`score_actions`函数,该函数接收环境提供的状态与动作特征,返回每个合法动作的得分。环境负责枚举合法动作、执行状态转移与最终精确性检查。数据集的训练集仅用于启发式发现,验证集用于最终程序选择,测试集(56个CrosscountryAD图)则用于正式的基准评估。所有方法均通过固定的`solve_graph`流程进行评测,其内置评估器按家族等权聚合归一化成本(候选成本/参照基线),得分越低表示性能越优。此外,数据包提供了完整的校验脚本与基线数据,便于复现与比较,确保评估的公平性与一致性。
背景与挑战
背景概述
自动微分(AD)是科学计算与深度学习的基石,其核心任务之一是在众多数学等价的计算路径中,寻找计算给定雅可比矩阵的最低成本策略,即AD规划(AD planning)。然而,最优雅可比累积(OJA)已被证明是NP-complete问题,且规划空间包含消元、混合切线/伴随传播等复杂操作,使得传统方法难以应对。为此,ADPlanBench统一基准于2026年由相关研究者构建,旨在为学习、搜索和评估AD规划策略提供标准化的平台。该基准包含顶点消元与广义AD规划两大轨道,提供了冻结的数据划分、逐图基线、统一动作打分接口与内置精确性检查,支持启发式、学习式与程序合成等方法,有力推动了该领域的研究进展。
当前挑战
AD规划面临的核心挑战在于其问题的NP-hard性,使得寻找全局最优策略在计算上不可行,现有方法往往陷入局部最优。此外,规划空间的高维性与异构性(涉及消元顺序、传播方向及显式矩阵乘法等决策)进一步加剧了策略搜索的难度。在基准构建过程中,挑战更为显著:需确保不同来源(如AlphaGrad、CrosscountryAD、ADMission)的数据格式统一与兼容,并设计严谨的评估协议以防止数据泄漏;同时,精确性验证需在不执行数值雅可比的前提下,通过结构指纹和确定性非交换矩阵指纹保证计算结果的正确性,这些技术难题均对数据集的可靠性与实用性提出了严苛要求。
常用场景
经典使用场景
该数据集作为自动微分规划领域的统一基准,其经典使用场景集中于评估和比较不同AD规划策略的性能。研究者可依据其冻结的训练、验证与测试划分,通过统一的动作打分接口接入启发式、学习式、搜索式或程序合成方法,并在顶点消元和广义规划两条赛道上衡量候选策略在计算精确Jacobian时的成本效率。其内建精确性检查与逐图参照基线,确保了不同方法间比较的公平性与可复现性,从而成为该领域方法验证与性能排行的标准平台。
解决学术问题
该数据集直面最优Jacobian累积问题NP完全性带来的计算挑战,为自动微分中的规划问题提供了一个结构化、可量化的学术研究载体。它解决了以往研究中因缺乏统一基准而难以公平比较不同消元排序、混合切向/伴随传播策略的难题,使学者能够系统地探索启发式设计、学习型决策与搜索算法在降低导数计算成本方面的潜力。其发布推动了AD规划从理论探讨走向实证研究,并为算法复杂度分析与近似策略的边界刻画提供了坚实的数据支撑。
衍生相关工作
该数据集的衍生工作主要围绕自动启发式设计(AHD)方法展开,如EoH、FunSearch和ReEvo等,这些方法利用该基准直接生成改进的评分函数,推动了无需人工干预的自动策略发现。此外,基于该基准涌现出针对顶点消元顺序的强化学习(如AlphaGrad PPO/AlphaZero)与混合搜索算法研究,以及针对广义AD规划的多动作决策模型。这些工作相互印证,共同促进了AD规划策略从手工设计向数据驱动方法的转型,并形成了活跃的研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务