遇见数据集

thuerey-group/PBFM

收藏
Hugging Face2025-12-02 更新2025-08-09 收录
官方服务:

资源简介:

Dynamic Stall数据集包含动态失速情况的数据,定义了四维设计空间,包括自由流马赫数、平均攻角、俯仰振幅和折减频率等设计变量。数据集由128个训练点和16个测试点组成,每个点经过扰动生成多个模拟数据,总共包含4096个训练模拟和512个测试模拟,每个模拟包含6个物理字段。Kolmogor夫流动数据集包含雷诺数在100到500范围内的流动情况,每个条件包含1024个快照,分为训练集和验证集。

The Dynamic Stall dataset contains data for dynamic stall cases, defined in a four-dimensional design space including free-stream Mach number, mean angle of attack, pitching amplitude, and reduced frequency. The dataset consists of 128 training points and 16 testing points, each perturbed to generate multiple simulations, totaling 4096 training simulations and 512 testing simulations, each with 6 physical fields. The Kolmogorov flow dataset contains flow conditions for Reynolds numbers ranging from 100 to 500, with each condition having 1024 snapshots, divided into training and validation sets.

提供机构:
thuerey-group
搜集汇总
数据集介绍
构建方式
在计算流体力学与科学机器学习的交叉领域中,数据集的构建需兼顾物理真实性与参数多样性。PBFM数据集围绕动态失速与Kolmogorov流两大经典流体问题精心设计。动态失速部分以四维超立方体定义设计空间,涵盖自由流马赫数、平均攻角、俯仰振幅及折合频率,采用128个训练点与16个测试点,每个名义工况通过均值为零、标准差为0.02的高斯噪声生成32个扰动变体,最终产生4096个训练样本与512个测试样本。Kolmogorov流部分则在雷诺数100至500区间内,利用TorchFSM求解器进行高保真模拟,包含32种训练流态与16种验证流态,每种流态提供1024个快照,确保物理场分布的全面覆盖。
使用方法
用户可通过HuggingFace平台直接下载PBFM数据集,将其应用于物理约束的流匹配模型训练与帕累托最优分析。动态失速数据集的HDF5文件包含fields、nominal_condition及real_condition数组,加载时需注意形状为(条件数, 每条件样本数, 场数, 128, 128),可依据设计变量索引提取特定工况下的物理场。Kolmogorov流数据集则提供fields与reynolds数组,便于按雷诺数筛选快照。推荐使用h5py或pandas库进行数据读取,并配合PyTorch或TensorFlow构建数据加载器,以支持批量训练与验证。数据集已标注MIT许可证,允许学术与商业用途,引用时请参照论文BibTeX条目。
背景与挑战
背景概述
在科学机器学习领域,物理信息融合与生成模型的交汇正催生新的研究范式。thuerey-group/PBFM数据集由慕尼黑工业大学Thuerey团队与米兰理工大学Baldan等人于2025年联合创建,发表于ICLR 2026,旨在探索物理约束下流匹配模型的帕累托最优权衡。该数据集聚焦两大核心流体动力学问题:动态失速(翼型非定常气动)与Kolmogorov流(湍流统计特性),通过高保真数值模拟生成包含压力、速度梯度、温度等多物理场的高维数据。其核心研究问题在于如何平衡生成数据分布的真实性与物理守恒律的满足度,为物理信息生成模型提供标准化基准。该数据集的影响力体现在它首次将多目标优化框架引入流匹配学习,推动了流体力学与深度学习的交叉融合。
当前挑战
该数据集所解决的领域挑战在于弥合数据驱动生成模型与物理先验知识之间的鸿沟——传统流匹配模型虽能生成逼真分布,却常违背Navier-Stokes方程等物理定律,而严格物理约束又可能牺牲生成多样性。构建过程中面临多重技术挑战:首先,动态失速案例需在四维设计空间(马赫数、攻角、振幅、折合频率)内高效采样,并引入2%高斯噪声模拟实际工况扰动,产生4096个训练样本,确保统计代表性;其次,Kolmogorov流案例需覆盖雷诺数[100,500]区间,每个工况生成1024个时间快照,对计算资源与数值稳定性提出严苛要求;此外,多物理场数据的统一存储格式(HDF5)与异构变量(标量、矢量、梯度)的标准化,以及训练/测试集划分的合理性验证,均是构建可靠基准的关键难题。
常用场景
经典使用场景
PBFM数据集在科学机器学习领域中,主要用于物理约束下的流匹配(Flow Matching)模型训练与评估。其经典使用场景聚焦于动态失速(Dynamic Stall)与科尔莫戈罗夫流(Kolmogorov Flow)两类典型流体动力学问题。动态失速数据集涵盖四维设计空间,包含马赫数、平均攻角、俯仰振幅与折合频率等关键参数,通过高斯扰动生成4096个训练样本与512个测试样本,每个样本提供压力、温度、密度等六类128×128流场物理量。科尔莫戈罗夫流数据集则覆盖雷诺数100至500范围,包含32种训练与16种验证流态,每类提供1024个速度场快照。该数据集为物理信息驱动生成模型提供了标准化的基准,特别适用于检验流匹配方法在保持物理一致性的同时生成高质量流场分布的能力。
解决学术问题
该数据集的核心学术价值在于解决物理约束下生成模型面临的帕累托最优权衡难题,即如何在流匹配框架下协调分布拟合精度与物理定律满足度之间的冲突。传统生成模型往往在生成样本的统计分布与物理可行性之间难以兼得,而PBFM数据集通过精确设计的参数化扰动与高保真仿真数据,为研究物理约束流匹配方法提供了定量评估平台。它使研究者能够系统性地探索模型在多种设计变量组合下的泛化边界,并量化物理残差与分布距离之间的折衷关系。该数据集的引入推动了科学机器学习领域对多目标优化问题的深入理解,尤其是在流体动力学中,为建立兼具统计真实性与物理可解释性的生成模型奠定了数据基础。
实际应用
在实际工程应用中,PBFM数据集支撑着流体动力学领域的快速设计与不确定性量化任务。动态失速数据集可应用于直升机旋翼、风力涡轮机叶片及高性能飞行器在非定常工况下的气动性能预测,通过生成模型快速评估不同设计参数组合下的流场特性,从而替代昂贵的高保真数值模拟。科尔莫戈罗夫流数据集则适用于湍流建模、流动控制策略优化及多尺度流动特征提取,为工业级流动仿真提供数据驱动的替代模型。此外,该数据集还能服务于物理信息生成模型的鲁棒性验证,帮助工程师在仅有限观测数据的情况下,生成符合物理规律的流场重构结果,显著降低设计迭代周期与计算资源消耗。
数据集最近研究
最新研究方向
在物理信息驱动与数据驱动方法深度融合的前沿探索中,thuerey-group/PBFM数据集为帕累托最优物理约束流匹配研究提供了关键支撑。该数据集聚焦于动态失速与科尔莫戈罗夫流两大经典流体力学问题,通过高维设计空间采样与噪声扰动策略,生成了涵盖压力、温度、密度及壁面剪切应力等多物理场的精细模拟数据。其核心价值在于突破了传统物理信息神经网络在复杂流动中精度与泛化性的权衡困境,为物理约束生成模型在湍流模拟、气动优化等热点方向开辟了新路径。该数据集的发布不仅推动了科学机器学习中“物理-数据”双驱动的范式演进,更对航空工程、气候建模等领域的低误差、高效率仿真具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务