遇见数据集

FM4PDE-pde-data

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该数据集是 FM4PDE(Guided Flow Matching for Forward and Inverse PDE Problems with Sparse Observations)的配套数值 PDE 数据,由 Xifeng Zhang 和 Jin Zhao 发布。数据集包含 11 个方程族的训练和测试样本:泊松方程、亥姆霍兹方程、达西流、纳维-斯托克斯方程、伯格斯方程、热传导方程、对流-扩散方程、反应-扩散方程、浅水方程、波动方程以及稳态热传导方程。数据以 .mat 和 .h5 格式存储,组织方式与 FM4PDE 代码期望的目录结构一致。完整发布版包含 55 个训练分片(共 550,000 个样本)和 29 个命名测试文件(共 218,000 个样本),每个方程族有 5 个训练分片(每片 10,000 样本),测试文件根据分布类型(ID、Smooth、Rough、Rough2、Rough3)命名。训练配置中默认使用每个方程族 50,000 样本池中的 45,000 训练和 5,000 验证样本。数据集适用于正向、逆向及联合重构问题,特别是稀疏观测场景下的物理信息机器学习。

This dataset is the accompanying numerical PDE data for FM4PDE (Guided Flow Matching for Forward and Inverse PDE Problems with Sparse Observations), released by Xifeng Zhang and Jin Zhao. The dataset contains training and test samples from 11 equation families: Poisson equation, Helmholtz equation, Darcy flow, Navier-Stokes equations, Burgers equation, heat equation, advection-diffusion equation, reaction-diffusion equation, shallow water equations, wave equation, and steady-state heat conduction equation. The data is stored in .mat and .h5 formats, organized in the directory structure expected by the FM4PDE code. The full release includes 55 training shards (550,000 samples in total) and 29 named test files (218,000 samples in total), with each equation family having 5 training shards (10,000 samples per shard). Test files are named according to distribution types (ID, Smooth, Rough, Rough2, Rough3). The training configuration uses 45,000 training and 5,000 validation samples from a pool of 50,000 samples per equation family by default. The dataset is suitable for forward, inverse, and joint reconstruction problems, particularly for physics-informed machine learning with sparse observations.

创建时间:
2026-09-28
原始信息汇总

FM4PDE-pde-data 数据集总结

数据集概况

  • 数据集名称:FM4PDE PDE Data
  • 数据集地址:https://huggingface.co/datasets/XifengZhang/FM4PDE-pde-data
  • 关联论文:Guided Flow Matching for Forward and Inverse PDE Problems with Sparse Observations: Algorithm and Theory,作者为 Xifeng Zhang 和 Jin Zhao
  • 论文链接:https://arxiv.org/abs/2605.25509
  • 代码仓库:https://github.com/Astringency/FM4PDE
  • 预训练模型:https://huggingface.co/XifengZhang/FM4PDE-pretrained-models
  • 用途:用于训练 FM4PDE,以及评估基于稀疏观测的正问题、逆问题和联合重建
  • 语言:en
  • 任务类别:other
  • 标签:scientific-machine-learning、physics-informed-machine-learning、partial-differential-equations、flow-matching、forward-problems、inverse-problems、sparse-observations、arxiv:2605.25509

数据覆盖的方程族

数据集覆盖十一个方程族:

  1. Poisson
  2. Helmholtz
  3. Darcy flow
  4. Navier–Stokes
  5. Burgers
  6. Heat
  7. Advection–diffusion
  8. Reaction–diffusion
  9. Shallow water
  10. Wave
  11. Steady heat conduction

数据以 .mat 和 .h5 文件形式提供,采用 FM4PDE 代码所需的目录结构。

数据配置与划分

数据集提供以下配置:all(默认)、poisson、helmholtz、darcy、nsnonbounded、burgers、heat、advection_diffusion、reaction_diffusion、shallow_water、wave、steady_heat_conduction。

每个配置包含 train 和 test 两个 split。

各配置样本数量

配置 训练文件 / Viewer 行数 训练样本数 测试文件 / Viewer 行数 测试样本数
poisson 5 50,000 5 32,000
helmholtz 5 50,000 5 32,000
darcy 5 50,000 5 32,000
nsnonbounded 5 50,000 5 32,000
burgers 5 50,000 3 30,000
heat 5 50,000 1 10,000
advection_diffusion 5 50,000 1 10,000
reaction_diffusion 5 50,000 1 10,000
shallow_water 5 50,000 1 10,000
wave 5 50,000 1 10,000
steady_heat_conduction 5 50,000 1 10,000
all 55 550,000 29 218,000
  • 训练/验证划分:每个方程的 50,000 样本训练池中,使用 45,000 训练样本和 5,000 验证样本。
  • 测试分布通过 distribution 列区分:ID、Smooth、Rough、Rough2、Rough3。
  • ID、Smooth、Rough 测试文件各含 10,000 样本;Rough2 和 Rough3 文件(如列出)各含 1,000 样本。

数据结构

各配置的特征字段一致,包括:

  • equation(string)
  • file_path(string)
  • num_samples(int64)
  • distribution(string)
  • size_bytes(int64)
  • format(string)
  • upload_status(string)
  • download_url(string)

Dataset Viewer 说明

  • Dataset Viewer 展示的是完整文件目录,每一行代表一个原始数据文件,而非一个数值 PDE 样本。
  • 选择 all 可浏览所有方程,或选择十一个方程配置之一,再选择 train 或 test。
  • num_samples 列给出该文件中的数值样本数。
  • 原始文件包含共享坐标数组、不同的样本轴约定以及 MATLAB/HDF5 布局,因此使用显式目录配置以避免 Viewer 将科学文件当作普通表格处理。
  • 原始数值字段保留原始格式,可通过 FM4PDE loaders、h5py 或 scipy.io.loadmat 读取。

文件清点

  • 完整文件清单包含 89 个文件:55 个训练分片、29 个命名测试文件、5 个兼容性测试副本。
  • 84 个训练/命名测试文件总计 697.38 GB;全部 89 个路径总计 728.93 GB(十进制文件大小,1 GB = 1,000,000,000 字节)。
  • 每个方程族有五个训练分片,每片 10,000 样本,每个方程的样本池为 50,000。

上传状态

  • 上传状态检查时间:2026-09-30 19:03:08 UTC+08:00
  • 该快照下:73/89 个文件已上传,16 个正在加载。
  • 状态检查对应数据集修订版本:5c1197bcdd93
  • ✅ 表示文件已提交到 Hub 且报告大小与发布清单匹配。
  • loading 表示检查时尚未提交;该状态为带日期的快照,并非实时进度显示。

各方程文件与大小概览

方程 训练文件 测试文件 大小 (GB) ✅ loading
Poisson 5 6 22.81 11 0
Helmholtz 5 6 22.81 11 0
Darcy flow 5 6 34.25 11 0
Navier–Stokes 5 6 198.97 8 3
Burgers 5 4 11.41 9 0
Heat 5 1 42.04 4 2
Advection–diffusion 5 1 42.05 3 3
Reaction–diffusion 5 1 87.60 3 3
Shallow water 5 1 216.72 4 2
Wave 5 1 45.64 3 3
Steady heat conduction 5 1 4.64 6 0
总计 55 34 728.93 73 16

测试文件计数包含五个兼容性副本;这些副本不是额外的独立测试集。

各方程文件明细

Poisson

  • 目录:poisson/
  • 内容:静态 2D 源到解对
  • 格式:MAT v5 文件,包含 f_data 和 phi_data,形状均为 (N, 128, 128)
文件 划分 / 角色 样本数 大小 (GB) 状态
poisson_10000-128-128_1.mat 训练分片 10,000 2.479 ✅
poisson_10000-128-128_2.mat 训练分片 10,000 2.479 ✅
poisson_10000-128-128_3.mat 训练分片 10,000 2.479 ✅
poisson_10000-128-128_4.mat 训练分片 10,000 2.479 ✅
poisson_10000-128-128_5.mat 训练分片 10,000 2.479 ✅
poisson_test_10000-128-128_id.mat 测试 · ID 10,000 2.479 ✅
poisson_test_10000-128-128_smooth.mat 测试 · Smooth 10,000 2.479 ✅
poisson_test_10000-128-128_rough.mat 测试 · Rough 10,000 2.479 ✅
poisson_test_1000-128-128_rough2.mat 测试 · Rough2 1,000 0.248 ✅
poisson_test_1000-128-128_rough3.mat 测试 · Rough3 1,000 0.248 ✅
poisson_test_10000-128-128.mat 兼容性副本 · Smooth 10,000 2.479 ✅

Helmholtz

  • 目录:helmholtz/
  • 内容:静态 2D 源到波场对
  • 格式:MAT v5 文件,包含 f_data 和 psi_data,形状均为 (N, 128, 128)
文件 划分 / 角色 样本数 大小 (GB) 状态
helmholtz_10000-128-128_1.mat 训练分片 10,000 2.479 ✅
helmholtz_10000-128-128_2.mat 训练分片 10,000 2.479 ✅
helmholtz_10000-128-128_3.mat 训练分片 10,000 2.479 ✅
helmholtz_10000-128-128_4.mat 训练分片 10,000 2.479 ✅
helmholtz_10000-128-128_5.mat 训练分片 10,000 2.479 ✅
helmholtz_test_10000-128-128_id.mat 测试 · ID 10,000 2.479 ✅
helmholtz_test_10000-128-128_smooth.mat 测试 · Smooth 10,000 2.479 ✅
helmholtz_test_10000-128-128_rough.mat 测试 · Rough 10,000 2.479 ✅
helmholtz_test_1000-128-128_rough2.mat 测试 · Rough2 1,000 0.248 ✅
helmholtz_test_1000-128-128_rough3.mat 测试 · Rough3 1,000 0.248 ✅
helmholtz_test_10000-128-128.mat 兼容性副本 · Smooth 10,000 2.479 ✅

Darcy flow

  • 目录:darcy/
  • 内容:2D Darcy 流的渗透率场和压力场
  • 格式:.mat 文件使用 HDF5 存储
  • 字段:thresh_a_data、thresh_p_data、lognorm_a_data、lognorm_p_data,存储形状为 (128, 128, N);使用 FM4PDE loader 选择系数族并调整轴顺序
文件 划分 / 角色 样本数 大小 (GB) 状态
darcy_10000-128-128_1.mat 训练分片 10,000 3.723 ✅
darcy_10000-128-128_2.mat 训练分片 10,000 3.723 ✅
darcy_10000-128-128_3.mat 训练分片 10,000 3.723 ✅
darcy_10000-128-128_4.mat 训练分片 10,000 3.723 ✅
darcy_10000-128-128_5.mat 训练分片 10,000 3.723 ✅
darcy_test_10000-128-128_id.mat 测试 · ID — — —

使用方式

加载文件目录

python from datasets import load_dataset

catalog = load_dataset("XifengZhang/FM4PDE-pde-data", "poisson") train_files = catalog["train"] # 5 条文件记录,代表 50,000 样本 test_files = catalog["test"] # 5 条文件记录,代表 32,000 样本

load_dataset 返回文件元数据,而非数值字段张量。

下载单个方程和划分的可用文件

python from huggingface_hub import hf_hub_download

local_paths = [] for record in train_files: if record["upload_status"] != "✅": continue # 目录快照时待上传;稍后可在 Files 标签页检查上传情况 local_paths.append(hf_hub_download( repo_id="XifengZhang/FM4PDE-pde-data", repo_type="dataset", filename=record["file_path"], local_dir="PDEdata", ))

补充说明

  • 原始各方程路径保持不变。
  • 关于存储布局,参考完整清单;关于数值数据加载和推理,参考 Download 和 Usage 部分。
  • 训练/验证划分(45,000/5,000)由 FM4PDE 训练配置在每个方程的 50,000 样本训练池内应用。
  • 该划分沿用现有训练分片和留出测试文件,不重新划分单个样本。
搜集汇总
数据集介绍
FM4PDE-pde-data 数据集图片
构建方式
该数据集面向稀疏观测下偏微分方程正问题与反问题的科学机器学习研究,以引导流匹配(Guided Flow Matching)框架为核心应用场景。其构建依托数值求解器,为十一个方程族生成成对输入与解场数据,涵盖Poisson、Helmholtz、Darcy流、Navier–Stokes、Burgers、热传导、对流扩散、反应扩散、浅水、波动与稳态热传导等典型方程。每个方程族由五个训练分片构成,每片含一万样本,形成五万样本的方程级训练池;训练配置从中划分四万五千样本用于训练、五千样本用于验证,测试端则按ID、Smooth、Rough、Rough2、Rough3等分布命名组织独立文件。原始数值字段以MAT v5或HDF5格式保存,并经过显式目录配置以规避通用表格读取器对共享坐标轴的误解析,确保科学数据结构完整保留。完整发布包含五十五个训练分片、二十九个命名测试文件及五个兼容性测试副本,总计八十九个文件,训练与命名测试文件合计约六百九十七吉字节。
特点
数据集以多方程族覆盖、分布分层测试与高保真数值场为显著特征。十一个方程族囊括静态边值问题与含时演化问题,兼顾椭圆、抛物与双曲型方程,能够支撑正问题求解、反问题识别与稀疏观测联合重建三类任务。测试集按ID、Smooth、Rough、Rough2、Rough3五种分布划分,用以评估模型在分布内与分布外粗糙度变化下的泛化行为,其中主测试文件通常含一万样本,粗糙度增强文件含一千样本。数据以MAT v5和HDF5两种格式存储,部分方程采用不同的样本轴约定与共享坐标数组,如Darcy流文件以HDF5保存并含阈值与对数正态两套系数场族。数据集附带五十五个训练分片与二十八个命名测试文件的目录清单,另含五个兼容性测试副本,文件状态以带日期的快照标注,涵盖五十五万训练样本与二十一万八千测试样本,兼顾完整发布口径与现实上传进度。
使用方法
使用该数据集时,可借助Hugging Face数据集库加载文件目录配置,例如以方程名诸如poisson作为配置名调用load_dataset,分别获取train与test划分的文件记录,每行对应一个原始数值文件而非单个数值样本。目录返回的是文件元数据,包括方程名、文件路径、样本数、分布标签、字节大小、格式、上传状态与下载链接,便于按需筛选与下载。对于数值字段张量的读取,应通过Hugging Face Hub的hf_hub_download按记录中的file_path下载所需文件,并先行检查upload_status是否为已上传状态,以避免获取快照中仍处加载中的文件。下载后的MAT与HDF5文件可分别经FM4PDE配套加载器、scipy.io.loadmat或h5py读取,并依据各方程族的轴约定与字段命名组织为训练或评估输入。该流程既支持完整仓库的按需取用,也支持单方程单划分的精细化下载,便于在有限存储条件下开展流匹配训练、前向预测与稀疏观测反演实验。
背景与挑战
背景概述
偏微分方程作为刻画连续介质力学、波动传播与扩散过程等自然现象的数学基石,其数值求解长期受制于传统离散格式在高维与复杂边界条件下的计算瓶颈。近年来,以物理信息神经网络与神经算子为代表的科学机器学习范式,为数据驱动的偏微分方程求解开辟了新路径,然而面向稀疏观测、覆盖多种方程族的统一基准数据仍属稀缺。在此背景下,Xifeng Zhang与Jin Zhao于2026年发布了FM4PDE-pde-data数据集,作为论文《Guided Flow Matching for Forward and Inverse PDE Problems with Sparse Observations: Algorithm and Theory》的配套资源。该数据集涵盖Poisson、Helmholtz、Darcy流、Navier–Stokes、Burgers、热传导、对流扩散、反应扩散、浅水波、波动及稳态热传导共十一个方程族,训练样本总量达55万条、测试样本21.8万条,并依据分布差异划分ID、Smooth、Rough等测试集,为深度模型在正问题、反问题及联合重构任务上的泛化评估提供了系统化数据基础,有力推动了流匹配方法在科学计算领域的规范化研究。
当前挑战
该数据集所面对的领域问题在于,从稀疏且可能带有噪声的观测中同时推断偏微分方程的解场与未知参数,其本质是高维非适定反问题,传统求解方法在观测稀疏时往往失效,而现有神经算子模型在跨方程族泛化与分布外测试条件下表现不稳定。就构建层面而言,数据集规模庞大,完整文件总量达728.93 GB,涵盖MATLAB与HDF5两种存储格式,字段维度与样本轴约定各异,给统一加载与解析带来困难;同时,上传快照显示89个文件中仅73个完成提交,16个仍处于加载状态,数据可用性存在不确定性。此外,不同方程族的样本数量、文件大小与网格分辨率差异显著,如Navier–Stokes与浅水波方程体积庞大,而稳态热传导数据量较小,对模型的尺度适应能力与训练效率构成挑战。测试集按ID、Smooth、Rough至Rough3逐级扩展分布偏移,进一步要求模型具备稳健的外推能力。
常用场景
经典使用场景
在科学机器学习与物理信息建模领域,偏微分方程的正问题与反问题长期构成核心挑战,尤其当观测数据呈现稀疏、噪声干扰或部分缺失时,传统数值方法往往难以兼顾精度与效率。FM4PDE-pde-data 正是在这一背景下构建的大规模数值数据集,涵盖 Poisson、Helmholtz、Darcy 流、Navier–Stokes、Burgers、热传导、对流–扩散、反应–扩散、浅水波、波动方程及稳态热传导等十一类方程族,其最经典的用途在于为流匹配模型提供训练与评测基准,使研究者能够在统一框架下开展正向求解、逆向参数识别以及稀疏观测下的联合重构实验,进而系统评估算法在 ID、Smooth、Rough 等不同分布上的泛化能力。
衍生相关工作
围绕 FM4PDE-pde-data,已衍生出一系列经典工作,包括 Guided Flow Matching for Forward and Inverse PDE Problems with Sparse Observations 所提出的算法与理论分析,以及配套的 FM4PDE 代码库与预训练模型。这些工作进一步催生了针对不同方程族的专用求解器、稀疏观测下的反演策略以及分布外泛化评估协议。数据集的公开亦促进了物理信息机器学习社区在流匹配、扩散模型与算子学习等方向的交叉研究,为后续基准测试与算法改进提供了可复用的数据基础。
数据集最近研究
最新研究方向
偏微分方程数值求解长期受制于网格离散化与高维状态空间的双重瓶颈,而稀疏观测下的正反问题联合重建更是科学机器学习领域亟待突破的难点。FM4PDE-pde-data数据集应运而生,涵盖Poisson、Helmholtz、Darcy流、Navier–Stokes、Burgers、热传导、对流扩散、反应扩散、浅水波、波动及稳态热传导共十一个方程族,提供55个训练分片与29个具名测试文件,总样本量达76.8万,存储规模逾728 GB。该数据集直接服务于引导流匹配(Guided Flow Matching)算法在稀疏观测条件下对前向与逆向PDE问题的统一求解,其测试集按ID、Smooth、Rough等分布层级划分,为评估模型在不同光滑性先验下的泛化能力提供了严谨基准。这一资源的发布标志着生成式模型与物理约束深度融合的新趋势,有望推动科学计算从传统数值格式向数据驱动范式的加速迁移,并对流体力学、电磁学及地球物理等依赖PDE建模的领域产生深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务