遇见数据集

polymathic-ai/acoustic_scattering_inclusions

收藏
Hugging Face2025-04-10 更新2025-04-12 收录
官方服务:

资源简介:

这是一个描述声波在具有不同散射性质的多种材料组成的域中传播的数据集。数据集包含了多个材料的不同散射特性下声波压力波的传播情况,适用于源优化问题以及在地质学和雷达设计中的逆散射问题。数据集中包含4000个轨迹,每个轨迹包含101个时间步长的256x256图像,涵盖了压力场、材料密度、材料声速和速度场等信息。

This dataset describes the propagation of acoustic waves through domains consisting of multiple materials with different scattering properties. It includes the propagation of acoustic pressure waves under various scattering characteristics of materials, which is applicable to source optimization problems and inverse scattering problems in geology and radar design. The dataset contains 4000 trajectories, each with 101 time steps of 256x256 images, covering pressure fields, material density, material sound speed, and velocity fields.

提供机构:
polymathic-ai
搜集汇总
数据集介绍
polymathic-ai/acoustic_scattering_inclusions 数据集图片
构建方式
该数据集源自《The Well Collection》,专注于声波在非均匀介质中的传播模拟。数据通过Clawpack软件生成,求解变系数声学方程,描述压力波在包含多种散射特性材料域中的演化。模拟域被划分为两个连续变化的子域,并随机添加1至15个椭圆体夹杂物,这些夹杂物具有显著不同的密度,其对数密度服从均匀分布。初始条件为1至4个随机放置的高压环,强度与半径随机采样。边界条件在y方向开放,x方向为反射壁。共生成4000条轨迹,每条轨迹包含101个时间步的256×256网格数据,总数据量约283.8 GB。
使用方法
用户可通过HuggingFace Hub加载数据,需预先安装`the_well`库(`pip install the_well`)。使用`WellDataModule`类指定数据集标识符`hf://datasets/polymathic-ai/`和名称`acoustic_scattering_inclusions`即可实例化数据模块。随后调用`train_dataloader()`方法获取训练数据加载器,按批次迭代处理。数据包含压力标量场、材料密度标量场、声速标量场及速度矢量场,适用于多元时间序列预测等任务。建议引用相关论文以规范学术使用。
背景与挑战
背景概述
声波在不连续介质中的传播是计算物理与地球科学领域长期关注的核心问题,尤其在矿物勘探与雷达设计中,逆散射问题对识别地下材料属性具有关键意义。由Polymathic AI团队于2024年创建的acoustic_scattering_inclusions数据集,依托Clawpack开源框架生成,系统模拟了声压波在包含随机椭圆体夹杂物的复杂域中的演化过程。该数据集收录了4000条高保真轨迹,每条轨迹涵盖101个时间步的256×256分辨率图像,总数据量达283.8 GB,为机器学习模型在非光滑、非连续物理场景中的泛化能力研究提供了前所未有的基准。作为The Well Collection的重要组成部分,该数据集不仅推动了物理信息驱动神经网络的发展,更在挑战传统数据驱动方法对间断界面的建模能力方面产生了深远影响。
当前挑战
该数据集的核心挑战首先体现在物理问题的复杂性上:声波在包含随机密度夹杂物的域中传播时,介质间断界面导致波速与压力场产生剧烈变化,而现有机器学习数据集多聚焦于光滑连续场景,难以捕捉此类不连续动力学特征。其次,数据构建过程面临显著计算瓶颈——每条轨迹需约15分钟在64核Intel Icelake处理器上以双精度运行,4000条轨迹的总生成耗时超过1000核时,对算力与存储提出了严苛要求。此外,夹杂物的几何多样性(1至15个随机旋转椭圆体)与密度对数跨度(-1至10)进一步增加了模型对多尺度非均匀结构的表征难度,使得该数据集成为检验物理驱动深度学习在间断介质中泛化能力的试金石。
常用场景
经典使用场景
该数据集的核心应用在于模拟声波在非均匀介质中的传播过程,尤其聚焦于含有随机夹杂物的复杂几何结构。通过构建包含连续变化子域与离散界面的二维声学模型,研究者能够利用高分辨率时空序列数据(101步256×256图像)训练神经网络,以逼近声压场、速度场及材料密度场的演化规律。这一场景为物理信息驱动与纯数据驱动的机器学习方法提供了兼具平滑与间断特征的基准测试平台,尤其适合验证模型在处理波传播不连续性时的鲁棒性与泛化能力。
解决学术问题
该数据集直击计算物理学中长期存在的核心挑战:如何高效且准确地模拟声波在具有随机夹杂物的异质介质中的散射行为。传统数值方法(如有限差分或有限元)在应对高对比度材料界面时往往面临计算成本高昂与数值色散问题。该数据集通过提供大规模、高保真的仿真数据,使得研究者能够探索神经网络作为替代求解器的可行性,例如学习从初始条件到完整时空场的映射,从而绕过偏微分方程的显式求解。这为反问题(如从散射波场反演夹杂物位置与密度)的机器学习解法开辟了新路径,显著推动了地球物理勘探与雷达设计领域的前沿研究。
实际应用
在实际工程中,该数据集所模拟的声波散射现象直接关联到地质勘探与无损检测等关键领域。例如,在地震勘探中,通过分析人工震源激发的声波在地层中的散射信号,可以推断地下矿藏或油气储集层的分布。该数据集提供的随机夹杂物场景,恰好模拟了复杂地质结构中异常体(如矿脉或空洞)的声学响应,为训练深度学习模型实现自动化反演提供了理想训练资源。此外,在工业无损检测中,该数据有助于开发能快速识别材料内部缺陷(如裂纹或夹杂物)的智能算法,从而提升航空、建筑等领域的安全检测效率。
数据集最近研究
最新研究方向
当前,acoustic_scattering_inclusions数据集在计算物理与机器学习交叉领域的前沿研究中扮演着关键角色。该数据集聚焦于含随机夹杂物的复杂声波散射问题,其核心挑战在于模拟波在不连续介质中的传播——这一场景广泛存在于地质勘探中的逆散射问题,例如通过识别地下矿藏或优化雷达设计。与传统的平滑物理模拟数据集不同,该数据通过引入随机生成的密度异常体(夹杂物)和多种背景介质分布(如高斯凸起、线性梯度等),构建了高度非均匀且非光滑的声学环境,为训练能够处理间断性与局部剧烈变化的物理信息神经网络(如PINNs)或神经算子(如FNO、DeepONet)提供了宝贵资源。近期研究趋势正利用此类数据推动从理想化平滑场景向真实复杂几何的迁移,尤其在源优化和材料反演任务中,该数据集的高保真度与多样性使其成为验证模型鲁棒性与泛化能力的基准,对推动地球物理与工程中的智能感知技术具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务