遇见数据集

TIDE

收藏
github2026-08-06 更新2026-08-12 收录
官方服务:

资源简介:

TIDE(湍流不可压缩DNS集合)是一个256³ fp64 DNS语料库和3D不可压缩湍流基准数据集:包含15种配置,覆盖八个受控物理轴(强迫各向同性/扩展物理/自由衰减),每种配置提供8-16个完全独立的实现(总共134个轨迹,约2.6TB),每个数据在通过统计门和方程级残差检查的固定接受标准后才发布。配套基准提供五个任务、固定协议下的审计基线、沿物理轴的泛化划分以及结合点误差的物理保真度指标。

TIDE (Turbulent Incompressible DNS Collection) is a 256³ fp64 DNS corpus and 3D incompressible turbulence benchmark dataset. It contains 15 configurations spanning eight controlled physical axes, including forced isotropic, extended physical, and free decay scenarios. Each configuration provides 8–16 fully independent realizations, totaling 134 trajectories with an approximate size of 2.6 TB. All data are released only after satisfying fixed acceptance criteria that pass statistical gatekeeping and equation-level residual checks. The accompanying benchmark offers five tasks, audit baselines under fixed protocols, generalization splits along physical axes, and physical fidelity metrics combined with pointwise errors.

创建时间:
2026-07-26
原始信息汇总

TIDE 数据集详情总结

数据集简介

TIDETurbulent Incompressible DNS Ensembles)是一个面向三维不可压缩湍流的科学机器学习基准数据集,由阿拉巴马大学和匹兹堡大学的研究团队共同构建。该数据集包含 256³ 分辨率的 fp64 直接数值模拟(DNS)数据,涵盖 15 种配置、8 条受控物理轴(受迫各向同性 / 扩展物理 / 自由衰减),共 134 条独立轨迹,数据总量约 2.6 TB。每条轨迹均需通过固定的统计门控和方程级残差检查验收标准后方可发布。

核心特点

  • 物理多样性:数据集沿 8 条受控物理轴系统设计,覆盖受迫各向同性湍流、旋转湍流、被动标量输运、分层湍流及自由衰减湍流等多种物理场景。
  • 严格验收标准:每条轨迹须通过 13 项统计门控(如分辨率等级、耗散解析、能谱尾部、尺度分离、能量漂移等)及方程级残差检查(散度残差、动量残差、时间步长收敛比等)。
  • 配套基准测试:提供 5 项任务(预报、超分辨率、稀疏重建、压力恢复、亚格子应力闭合)、5 种学习基线(FNO3d、TFNO、Spectral U-Net、Transolver、DeepONet-3D)及多种非学习参考方法,并附带物理保真度指标。

数据组成与访问

  • 数据存储:数据以分块 zarr 格式存储于 HuggingFace(仓库索引 ydai17/TIDE),每个配置对应一个仓库,包含速度场(fp32)、压力场、可选的被动标量/浮力通道、每帧时间戳及归一化参数文件。
  • 下载方式:可通过 huggingface-cli download 命令下载单个配置(约 20 GB/轨迹),或通过 DOI 记录(10.5281/zenodo.21589489)获取完整数据集。
  • 基准切分:数据集附带确定性的训练/验证/测试切分清单(benchmark_slice.json),按模型无关质量分数对轨迹排序后分配(前 3 条训练、第 4 条验证、后 3 条测试)。

15 种配置详情

物理族 配置名称 说明
受迫各向同性 Re_lambda 86, Re_lambda 70, Re_lambda 55 不同泰勒雷诺数旗舰配置
受迫各向同性 k_f = 3, k_f = 4 不同强迫波数
受迫各向同性 tau = 1 不同强迫时间尺度
受迫各向同性 helical 螺旋湍流
扩展物理 rotating (strong, moderate) 强/中等旋转(Rossby 数 0.2)
扩展物理 passive scalar 被动标量输运
扩展物理 stratified 分层湍流(浮力)
自由衰减 decay (hot-start) 热启动衰减
自由衰减 decay (Saffman), decay (Batchelor) 冷启动衰减族
自由衰减 decay (ABC) ABC 流初始条件衰减

关键技术指标

  • 生成成本:单条 256³ 轨迹约需 7 GPU 小时(RTX 5090 级别 32 GB 显卡)。
  • 硬件要求:生成需 fp64 精度,训练可用 bf16 精度,需 Python ≥3.10、PyTorch ≥2.7(CUDA)。
  • 验收标准:Class I 分辨率要求 k_max*η ≥ 1.5;扩展物理配置额外增加 Batchelor 尺度(标量)或 Ozmidov 尺度(分层)等分辨率门控。
  • 基准协议:统一固定学习率 1e-3、残差预测、本征 256³ 评估、51 个评估窗口,训练单任务约 0.2-0.9 小时。

数据集发布信息

引用方式

bibtex @misc{dai2026tide, title={TIDE: A Physically Diverse 3D Turbulence Benchmark Dataset for Advancing Scientific Machine Learning}, author={Yilong Dai and Yiming Sun and Yiheng Chen and Shengyu Chen and Peyman Givi and Xiaowei Jia and Runlong Yu}, year={2026}, eprint={2608.04222}, archivePrefix={arXiv}, primaryClass={physics.flu-dyn}, url={https://arxiv.org/abs/2608.04222}, }

搜集汇总
数据集介绍
TIDE 数据集图片
构建方式
TIDE数据集是基于直接数值模拟(DNS)构建的物理多样化的三维不可压缩湍流基准数据集。其构建流程严谨,涵盖四个阶段:首先,通过伪谱法DNS求解器在fp64精度下进行长时间模拟,丢弃spin-up窗口后以固定时间间隔导出物理场快照;随后,将快照转换为分块zarr存储格式,并冻结归一化参数;接着,对每个配置进行严格的统计门控和方程级残差校验,确保数据符合湍流物理规律;最后,生成确定性的训练/验证/测试划分清单。整个语料库包含15个配置,覆盖强迫各向同性、扩展物理(旋转、分层、被动标量)和自由衰减三大类,每个配置提供8至16个完全独立的系综样本,总计134条轨迹,数据量约2.6TB。
特点
TIDE数据集的核心特点在于其物理多样性和数据质量的可信度。在物理层面,它系统地控制了八个物理轴,包括雷诺数(Re_lambda从55至86)、强迫尺度、时间相关性、螺旋度、旋转速率、分层强度、标量输运以及衰减类型,为科学机器学习提供了丰富的泛化测试场景。在数据质量层面,每个配置均需通过由13项二元统计门控(如耗散解析度、尺度分离、各向同性等)和方程级残差检查(包括动量残差、时间收敛率和压力-速度泊松一致性)组成的验收标准,确保数据的物理真实性和数值精度。此外,数据集提供了冻结的归一化参数和模型无关的质量评分机制,便于公平比较不同算法。
使用方法
使用TIDE数据集需遵循标准化流程。首先,通过HuggingFace下载所需配置的zarr文件,并设置TURBGEN_DATA_DIR环境变量指向数据根目录。基准测试应始终通过run_benchmark_suite.py启动,该入口会锁定所有训练协议参数(如残差预测、学习率1e-3、原生256³分辨率评估等),避免因直接调用训练脚本导致协议不一致。数据集支持五种任务:滚动预测、超分辨率、稀疏重建、压力恢复和亚网格应力闭合,并提供了五种学习型基线(FNO3d、TFNO、Spectral U-Net、Transolver、DeepONet-3D)及多种非学习参考方法。用户可通过--configs和--tasks参数灵活指定评估矩阵,并利用--dry-run预览任务分配。所有测试结果均以JSON行格式输出,便于重建排行榜与复现论文中的实验结果。
背景与挑战
背景概述
湍流作为经典力学中尚未完全攻克的核心难题,其多尺度非线性特性对科学机器学习模型的构建构成了严峻挑战。在此背景下,阿拉巴马大学与匹兹堡大学的联合研究团队于2026年推出了TIDE(Turbulent Incompressible DNS Ensembles)数据集。该数据集基于256³分辨率的fp64直接数值模拟,精心设计了涵盖强迫各向同性、扩展物理(如旋转、分层、被动标量)及自由衰减等15种物理构型,总计134条独立轨迹,数据量约2.6 TB。TIDE不仅为三维不可压缩湍流提供了高保真、物理多样的数据支撑,更通过严格的统计门控与方程级残差校验确立了数据质量基准。其发布填补了现有湍流数据集在物理多样性、规模及标准化评估协议方面的空白,为科学机器学习在流体力学中的应用提供了重要基准,推动了该领域向更可靠、可复现的方向发展。
当前挑战
TIDE数据集所应对的挑战深远且棘手的。首要挑战在于物理复杂性与数据获取的平衡:三维湍流的宽谱时空尺度要求极高的计算资源,单条轨迹需耗费约7 GPU小时,而构建15种不同物理条件的集合需数千次模拟,并需确保各配置间的统计独立性和物理差异性,以避免数据冗余或隐含偏差。其次,数据验证面临严峻考验,需通过十三项统计门控(如分辨率裕度、各向同性、能量漂移)及方程级残差检验来确保数值解的物理一致性,这对标准的设定和执行提出极高要求。此外,湍流固有的非线性混沌特性使得训练机器学习模型时需特别处理误差累积和泛化能力问题,如何设计跨越不同物理轴的训练/测试分割以评估模型的物理外推性能,是一大方法论挑战。最后,构建过程中还需克服工程难题,包括大规模数据(约2.6 TB)的高效存储、分块读取及规范化的归一化流程,并确保所有基线模型在统一协议下公平比较,这些均构成了该数据集在构建与解决科学问题中所面临的现实瓶颈。
常用场景
经典使用场景
TIDE数据集作为三维不可压缩湍流直接数值模拟(DNS)的高保真相位空间基准,其经典使用场景集中于科学机器学习模型的训练与验证。研究者利用其15种不同物理配置(涵盖强迫各向同性、旋转、分层、被动标量及自由衰减等)及134条独立轨迹,开展湍流场时空演化预测、超分辨率重建、稀疏观测重构、压力场恢复及亚格子应力闭合等任务。数据集的256³网格分辨率和fp64精度确保了湍流小尺度结构的完整解析,为评估模型在复杂非线性动力学系统中的泛化能力提供了标准化的评测平台。
实际应用
在实际应用中,TIDE数据集为高精度湍流模拟的降阶替代模型开发提供了关键支撑,其衍生模型可大幅降低计算成本,用于工程湍流(如航空发动机燃烧室、风力机尾流)的快速预测。此外,基于该数据集训练的超分辨率与重建算法,能够从稀疏实验测量(如粒子图像测速)中恢复高分辨率流场,助力实验流体力学的数据增强。数据集中的旋转与分层配置对地球物理流动(如海洋环流、大气边界层)的机器学习建模尤为重要,可支持气候预测和海洋工程中的湍流参数化方案优化。其开源许可和标准化接口也便于工业界直接集成到现有仿真流程中,加速数字孪生等技术的落地。
衍生相关工作
TIDE数据集的发布催生了一系列衍生工作,包括基于其基准协议对现有神经算子架构(如FNO3d、TFNO、Spectral U-Net、Transolver、DeepONet-3D)的系统性重评估,揭示了不同模型在物理外推场景下的性能边界。研究者还借鉴其质量控制理念,开发了针对湍流数据集的自动验真工具和物理一致性训练损失函数,如结合方程残差的正则化方法。此外,该数据集被用于探索生成式模型(如扩散模型和生成对抗网络)在湍流场合成中的应用,以及基于图神经网络或Transformer的湍流大涡模拟亚格子模型改进。其多物理轴的设计也激发了对科学机器学习中分布偏移和因果推断的研究,促进了领域泛化理论在偏微分方程学习中的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务