遇见数据集

Neptuna benchmark dataset

收藏
arXiv2026-07-24 更新2026-07-28 收录
数据链接:
官方服务:

资源简介:

Neptuna数据集是由慕尼黑工业大学团队创建的高保真可压缩多相流基准数据集,专门针对冲击驱动的气泡破裂和液滴破碎等复杂物理现象。该数据集包含2.4 TB的二维和三维高分辨率模拟数据,涵盖了空气泡在水中破裂、液滴在空气中破碎以及R22气泡在空气中相互作用等多种场景,数据通过ALPACA求解器和RDEMIC方法生成。数据集旨在为机器学习代理模型提供全面的训练和评估基准,解决可压缩多相流中冲击波与物质界面相互作用的建模难题,应用于计算流体动力学、航空航天和能源工程等领域。

The Neptuna dataset is a high-fidelity compressible multiphase flow benchmark dataset created by the research team at the Technical University of Munich, specifically targeting complex physical phenomena such as shock-driven bubble collapse and droplet breakup. This dataset encompasses 2.4 terabytes of 2D and 3D high-resolution simulation data, covering diverse scenarios including air bubble collapse in water, droplet breakup in air, and R22 bubble interactions in air, with all data generated using the ALPACA solver and the RDEMIC method. The dataset aims to provide comprehensive training and evaluation benchmarks for machine learning surrogate models, address the modeling challenges associated with shock wave-matter interface interactions in compressible multiphase flows, and find applications in fields such as computational fluid dynamics, aerospace engineering, and energy engineering.

提供机构:
慕尼黑工业大学
创建时间:
2026-07-24
搜集汇总
数据集介绍
Neptuna benchmark dataset 数据集图片
构建方式
在可压缩多相流动领域,激波与材料界面的强非线性相互作用催生了诸如气泡溃灭和液滴破碎等复杂现象,而构建可靠的机器学习代理模型长期受困于高质量基准数据的匮乏。Neptuna benchmark dataset应运而生,它基于高保真有限体积求解器ALPACA和鲁棒离散方程方法RDEMIC,通过求解可压缩欧拉方程组,系统性地生成了涵盖二维与三维的六个数据集。这些数据集聚焦于激波诱导的气泡溃灭与液滴破碎两大典型工况,包含了不同的材料属性、边界条件以及初始参数,如气泡或液滴的数量、半径、位置和激波马赫数等,从而构建起一个规模达2.4TB的高保真基准集合。
特点
该数据集最显著的特点在于其专为含激波的复杂可压缩多相流设计,填补了现有公开数据集在激波与多相效应联合作用下的空白。数据集不仅囊括了气-液(如水中气泡)与气-气(如空气中R22气泡)两种截然不同的相界面动力学,更创新性地引入了开放边界与对称边界等多种构型以丰富流动物理场景。尤为独特的是,液滴破碎数据集统一包含了瑞利-泰勒穿刺与剪切诱导夹带两种截然不同的破碎模态,对代理模型依据条件参数推断动力学机制并进行自回归预测的能力提出了严峻挑战。
使用方法
使用该数据集时,研究者可从HuggingFace平台获取以HDF5格式存储的轨迹数据,每个轨迹对应一组特定的初始条件参数。模型的训练采用多对一的策略,即将四个连续历史快照作为输入,预测下一个时间步的物理场,并通过自定义归一化层将模拟参数作为条件信息注入架构。除了标准的均方误差损失,Neptuna框架还支持结合H1半范数、结构相似性指数和界面聚焦均方根误差的复合损失函数,并可搭配SoftAdapt或GradNorm等自适应权重策略进行优化,最终在包含点态、谱、结构及物理信息等12项指标的体系下进行全面评估。
背景与挑战
背景概述
Neptuna benchmark dataset由慕尼黑工业大学的研究团队于2026年创建,旨在为可压缩多相流领域提供首个大规模标准化基准。核心研究问题聚焦于解决冲击波驱动下多相流(如气泡溃灭与液滴破碎)的高保真数值模拟与机器学习代理建模之间的鸿沟。该数据集包含2.4TB的高精度二维与三维数据,覆盖了气液与气气等多种构型,为评估卷积、谱方法、Transformer及预训练PDE基模型等代理模型提供了统一平台。其发布极大地推动了科学机器学习在复杂多相流领域的应用,为后续模型评估与算法设计奠定了坚实基础。
当前挑战
该数据集所解决的核心领域挑战在于:可压缩多相流中冲击波与相界面强非线性耦合导致的复杂界面变形、多尺度动力学及拓扑变化,使得传统机器学习模型难以同时捕捉可压缩性、尖锐间断与多相效应。构建过程中面临的挑战包括:需生成冲击诱导气泡溃灭与液滴破碎的高保真数据,要求求解器在极高时空分辨率下精确捕获激波与界面的相互作用;同时,在确保质量、动量与能量守恒的前提下,对庞大原始数据进行保守降采样,以平衡计算成本与数据保真度;此外,还需设计覆盖点态、谱、结构、特征聚焦及物理信息等多维度的评估指标体系,以全面衡量不同代理模型的预测能力。
常用场景
经典使用场景
在可压缩多相流领域,冲击波与物质界面的非线性相互作用催生了气泡溃灭与液滴破碎等复杂动力学现象,而传统数值模拟因高昂的计算成本难以支撑大规模参数化研究。Neptuna benchmark dataset作为首个专为冲击驱动的可压缩多相流设计的海量基准数据集,提供了2.4TB高保真度的二维与三维数据,涵盖气泡溃灭与液滴破碎两大经典场景。该数据集的经典使用场景在于系统性地评估与比较各类机器学习代理模型,包括卷积网络、谱方法、Transformer架构以及预训练的PDE基础模型。研究者可基于统一的标准化流程,在多尺度、强非线性的流场中验证模型的预测能力,尤其是在界面追踪、激波捕捉及频谱保真度等关键维度上,从而为代理模型的选型与优化提供可靠的评测基准。
实际应用
在实际工程场景中,Neptuna benchmark dataset助力推动了可压缩多相流快速预估技术的落地应用。例如,在水下结构保护的气泡帷幕设计、冲击波碎石术的优化以及高速燃烧中的燃料雾化与喷雾动力学研究中,高保真数值模拟耗时巨大,而基于该数据集训练的代理模型能够在保持关键物理特征的前提下实现近乎实时的流场演进预测。特别是在液滴破碎的多模态识别与气泡溃灭的能量聚焦分析等任务中,预训练模型经过微调后能够快速适应不同韦伯数与马赫数下的物理情境,为工业级的快速参数扫描与实时监控提供了可靠的工具支撑。
衍生相关工作
Neptuna benchmark dataset的发布引发了若干衍生研究工作。在其评测框架的启发下,研究者进一步探索了更精细的边界条件编码策略,将对称性与开放性边界信息融入标准化层,从而提升了代理模型在不同仿真配置间的迁移能力。此外,该数据集对细微尺度界面动力学与碎片化过程难以精准捕获的局限,催生了面向小尺度液滴剥离与激波反射效应的新型架构设计,如融合多尺度小波分析与注意力机制的混合模型。同时,该工作直接推动了更高复杂度数据集的建设,例如涵盖化学反应与相变的多相流基准,进一步拓展了数据驱动代理模型在极端物理条件下面临的挑战边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务