遇见数据集

PipeNeXtGen

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

PipeNeXtGen 数据集包含 6000 个合成的供水管网(WDN)模型,已划分为训练集、验证集和测试集。该数据集旨在支持图神经网络(GNN)在供水管网建模中的应用,例如节点分类、边属性预测或图级回归任务。数据以多种格式存储:torch_data.pt 文件包含 PyTorch Data 对象,每个对象包含 edge_index(边索引,形状 [2, e])、x(节点特征,包括高程、需求、坐标、特殊标记、网络总需求、节点数、到水源的距离)、edge_attr(目标参数——管道直径,可取 0、0.1524、0.2032、0.254 或 0.3048 米)、edge_known(已知边特征——长度)以及 g(图特征——总网络需求和总节点数)。此外,val.pkl、test.pkl 和 train.pkl 文件分别存储相应的 NetworkX 图。final_data.pkl 文件集成了所有 WDN 模型的 torch data 和 NetworkX 图,但需要使用 PipeNeXtGen Python 库才能正确读取。该数据集可供研究人员和工程师用于开发和评估供水管网相关的图学习模型。

The PipeNeXtGen dataset contains 6000 synthetic Water Distribution Network (WDN) models, divided into training, validation, and test sets. This dataset is designed to support the application of Graph Neural Networks (GNNs) in WDN modeling, such as node classification, edge attribute prediction, or graph-level regression tasks. Data is stored in multiple formats: torch_data.pt files contain PyTorch Data objects, each containing edge_index (edge indices, shape [2, e]), x (node features including elevation, demand, coordinates, special markers, total network demand, number of nodes, distance to water source), edge_attr (target parameter - pipe diameter, can be 0, 0.1524, 0.2032, 0.254, or 0.3048 meters), edge_known (known edge feature - length), and g (graph features - total network demand and total number of nodes). Additionally, val.pkl, test.pkl, and train.pkl files store the corresponding NetworkX graphs. The final_data.pkl file integrates torch data and NetworkX graphs for all WDN models, but requires the PipeNeXtGen Python library to be read correctly. This dataset is available for researchers and engineers to develop and evaluate graph learning models related to water distribution networks.

创建时间:
2026-09-08
原始信息汇总

PipeNeXtGen 数据集概述

数据集简介

PipeNeXtGen 是一个包含 6,000 个合成供水管网(WDN)模型的数据集,数据被划分为训练集、验证集和测试集三个部分。该数据集基于 MIT 许可证发布,其配套的生成代码可在 GitHub 上的 PipeNeXtGen Python 仓库中获取。

数据存储与文件结构

数据集中包含以下几种文件类型,每种文件存储不同格式的管网数据:

文件名称 内容描述
torch_data.pt 每个文件包含一个 PyTorch Data 对象列表,每个对象包含以下组件:<br>- edge_index:边索引,由两组成对节点数组构成,形状为 [2, e](e 为边的数量)<br>- x:节点特征,包括高程(elevation)、需水量(demand)、坐标(x, y)、特殊标记(special)、管网总需水量(network_demand)、节点数量(num_nodes)及水源距离(dist_source)<br>- edge_attr:目标参数——管径,可取值为 0、0.1524、0.2032、0.254 或 0.3048 米<br>- edge_known:已知边特征,包括管长(length)<br>- g:图级特征,包括管网总需水量和节点总数
val.pkl / test.pkl / train.pkl 每个供水管网模型对应的 NetworkX 图对象
final_data.pkl 一个 GNN_Data 对象,同时包含所有管网模型的 torch 数据和 NetworkX 图。该文件需要使用 PipeNeXtGen Python 仓库才能进行反序列化读取
搜集汇总
数据集介绍
PipeNeXtGen 数据集图片
构建方式
PipeNeXtGen数据集是面向供水管网(WDN)建模与智能分析而精心构造的综合性资源,其核心由6,000个合成供水管网模型构成,并被科学划分为训练集、验证集与测试集三个子集。该数据集的构建过程与配套的Python代码仓库紧密耦合,采用了一种多形态数据存储策略,以支持从不同层面进行的机理分析与图神经网络(GNN)研究。具体而言,每一份torch_data.pt文件整合了PyTorch的Data对象列表,每个对象系统性地封装了图的结构与属性信息,包括连接节点的edge_index、涵盖高程与需水量等物理属性的节点特征x、以管径为目标参数的edge_attr、包含管长的已知边特征edge_known,以及记录网络总需水量与节点数量的全局图属性g。与此同时,val.pkl、test.pkl与train.pkl文件为每个管网模型提供了NetworkX图表示,便于采用传统图算法开展精细研究。此外,数据集还提供了一个整合所有模型信息的final_data.pkl文件,封装了torch数据与NetworkX图的联合体,其加载必须依托于PipeNeXtGen专属的Python工具库,以确保数据形态的高度一致性与可复现性。
使用方法
使用PipeNeXtGen数据集开展研究时,科研人员应遵循一个自上而下、循序渐进的分析流程。首要步骤是依据研究目标选取合适的数据格式:对于图级别任务,可以直接加载包含PyTorch Data对象的torch_data.pt文件,通过edge_index构造邻接矩阵,并以edge_attr作为监督信号训练GNN模型,实施管径分类预测;对于需要深入探索网络局部结构或依赖经典图论算法的场景,则推荐读取对应的NetworkX图(train.pkl、val.pkl与test.pkl),以便利用成熟的分析工具,如计算度分布、最短路径等,进而用于特征工程。在此过程中,应确保各文件间的对应关系,避免因数据格式不匹配导致的信息缺失。当需要对整个水务网络进行复杂剖析时,引用final_data.pkl文件,并借助PipeNeXtGen的官方代码库进行解析,能够快速整合多种数据形态,从而加速实验流程。此外,数据集中预置的划分方式已考虑到随机性与代表性,使用时可直接沿用,以利于横向对比不同算法的性能。综合运用这些数据接口,研究者既能高效训练深度学习模型,又能保持对网络内在物理机理的可解释性,充分发挥该数据集的多重价值。
背景与挑战
背景概述
PipeNeXtGen数据集于2023年由研究团队创建,其核心研究问题聚焦于利用图神经网络(GNN)实现供水管网(WDN)的自动化设计,特别是管道直径的智能预测。该数据集包含6,000个合成供水管网模型,并划分为训练、验证和测试子集,由爱达荷国家实验室等机构的研究人员发布,代码开源在GitHub上。该数据集填补了供水管网领域缺乏大规模标准化图结构数据的空白,为GNN在基础设施工程中的应用提供了基准,推动了机器学习与水利工程的交叉研究,对智能城市供水系统的优化设计具有重要影响力。
当前挑战
当前挑战涵盖领域问题与数据构建两大方面。领域层面,供水管网设计需在复杂水力约束下优化管道直径,传统方法依赖物理模拟且计算昂贵,而图数据挖掘需处理节点与边的异质性、流量不确定性和拓扑多样性,模型泛化能力面临考验。构建层面,合成网络的生成需兼顾现实性与多样性,确保涵盖不同规模、形状和需求模式;数据标注依赖工程经验,直径离散化需合理设定;同时,处理6,000个模型的存储、平衡性,以及提供图属性(如总需求)以保证GNN训练稳定性,均构成技术难点。
常用场景
经典使用场景
PipeNeXtGen数据集作为供水管网(WDN)领域的合成数据资源,其核心价值在于为图神经网络(GNNs)在管网拓扑结构上的学习提供标准化的训练基准。该数据集包含6000个合成WDN模型,每个模型以图数据形式存储,节点特征涵盖高程、需水量、坐标及源距离等物理量,边特征则包含管道长度与目标直径,并额外提供网络级需求与节点总数等图属性。这种数据结构特别适合开展基于GNN的管道直径预测任务,即给定管网拓扑、节点需水与已知边属性,推断各管道的设计直径,从而支持管网系统设计与优化研究。由于数据划分明确(train/validation/test),研究者可复现实验并进行跨模型比较,这使得该数据集成为评估GNN在物理基础设施领域性能的标准平台。
解决学术问题
该数据集针对供水管网设计中的关键学术问题——即如何在缺乏真实大规模管网数据的情况下,高效预测管道直径——提供了解决方案。传统方法依赖于水力模拟和手工规则,难以适应复杂拓扑,而PipeNeXtGen通过生成多样化的合成WDN模型,并封装为图结构,使得研究者能以监督学习方式训练GNN模型,直接从图中学习管网拓扑与物理属性间的映射关系。这解决了两个核心问题:其一,缓解真实管网数据稀缺与隐私限制,提供大规模可复用的合成样本,支持深度模型的训练与验证;其二,建立标准化基准,使不同架构(如GCN、GraphSAGE、GAT)在相同条件上可比,从而推动图表示学习在基础设施工程领域的理论发展,例如探索消息传递机制对管道属性预测精度的影响。
实际应用
在实际应用中,PipeNeXtGen数据集可助力智慧水务系统的智能化进程。基于该数据集训练的GNN模型能够快速、准确地估算新管网的管道直径,进而辅助供水公司的前期规划与改造决策,减少对专家经验的依赖,提升设计效率。此外,该模型可集成至地理信息系统(GIS),实现管网资产数字化管理,自动检测现有网络中的薄弱环节或直径不匹配导致的压力不足问题。在应急场景下,模型还能依据实时监测数据(如需水量变化)动态评估管网适应性,支持漏损定位与拓扑调整。由于数据源自合成但物理规则贴近实际,模型经迁移学习后或可逐步适应真实管网数据,为城市水资源管理提供前瞻性工具,推动基础设施的可持续运维。
数据集最近研究
最新研究方向
PipeNeXtGen数据集聚焦于供水管网(WDN)的合成建模,面向图神经网络(GNN)在基础设施智能管理中的前沿应用。当前研究热点集中于利用该大规模合成数据(6000个模型)训练鲁棒的GNN,以实现管网管径的精准推断与优化设计。结合数字孪生与智慧城市发展,该数据集为探索管网拓扑结构学习、多尺度特征融合以及半监督学习等方向提供了基准,推动了AI在供水系统可靠性分析与资源高效配置中的落地,其开放许可(MIT)亦促进了跨机构协作研究,加速了算法从实验室到实际工程的迁移。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务