遇见数据集

Cross-Domain Volume Database

收藏
arXiv2026-07-21 更新2026-07-22 收录
数据链接:
官方服务:

资源简介:

该数据集是一个大规模跨领域科学模拟体积数据库,由圣母大学研究团队构建,旨在为学习型体积压缩模型提供多样化训练数据。数据库包含6376个经过筛选的体积数据,源自21个不同科学领域的模拟项目,覆盖了天体物理、湍流燃烧等多种物理量和空间结构。数据集通过感知哈希技术进行去冗余处理,确保样本多样性以提升模型泛化能力。该数据库主要用于训练EVOLVE压缩框架,解决科学模拟数据在离线存储和传输中的高压缩比需求,支持跨领域泛化压缩任务。

This dataset is a large-scale cross-domain scientific simulation volumetric database, constructed by the research team at the University of Notre Dame, aiming to provide diverse training data for learned volumetric compression models. The database contains 6,376 curated volumetric datasets derived from simulation projects across 21 distinct scientific disciplines, covering various physical quantities and spatial structures such as astrophysics and turbulent combustion. The database utilizes perceptual hashing technology for redundancy removal, ensuring sample diversity to enhance the model's generalization capability. It is primarily used to train the EVOLVE compression framework, addressing the high compression ratio requirements of scientific simulation data during offline storage and transmission, and supporting cross-domain generalized compression tasks.

创建时间:
2026-07-21
搜集汇总
数据集介绍
Cross-Domain Volume Database 数据集图片
构建方式
科学计算领域产生的大规模体数据对存储和传输构成了严峻挑战,促使高效有损压缩成为关键需求。为克服传统压缩方法在高压缩比下细节丢失严重、隐式神经表征方法需逐体优化且速率固定的局限,研究者构建了Cross-Domain Volume Database。该数据库从多个公开科学模拟数据集(如Open SciVis Datasets、IEEE SciVis Contest档案等)中收集了来源21个科学模拟的9,921个体数据,并采用基于感知哈希(pHash)的3D离散余弦变换策略度量结构相似性,通过最近邻相似度指标识别并剔除冗余帧,最终精炼为6,376个高多样性体数据,为训练具有跨域泛化能力的压缩模型奠定了数据基础。
特点
该数据库的最大特点在于其大规模、跨领域与高多样性的有机融合。覆盖天体物理、燃烧、气候等多个科学模拟领域的体数据,使模型能够学习可迁移的特征表示。区别于传统小规模或单一模拟数据集,该库的感知哈希去重机制有效避免了因相邻时间步高度冗余导致的模型过拟合,显著提升了数据分布的广度与均衡性。基于此多样性与均衡性,在该库上训练的EVOLVE模型无需针对每个个体进行优化,即可对同一领域内的未见体数据实现极佳的压缩泛化性能。
使用方法
该数据库专用于训练EVOLVE框架下的自编码器压缩模型。使用时,所有6,376个体数据作为训练集,不沿时间轴分割,以防止因帧间强相关性导致评估虚高。评估则使用与该库完全无交集的独立测试数据集(如asteroids、gas等)。研究者在训练过程中采用随机裁剪、翻转与旋转等数据增强策略,以增强模型对空间变化的鲁棒性。最终,一个在该库上训练完成的单一模型即可支持对覆盖域内未见体数据的离线压缩与连续变速率编码,极大提升了实用性与部署便捷性。
背景与挑战
背景概述
跨域体数据库(Cross-Domain Volume Database)由圣母大学Kaiyuan Tang、Maizhe Yang和Chaoli Wang团队于2025年构建,旨在解决大规模科学模拟数据压缩中传统方法在高压缩比下丢失精细结构、隐式神经表示需逐体优化且压缩比固定的核心问题。该数据库从21个科学模拟中精选6,376个体数据,覆盖天体物理、气候科学、湍流燃烧等领域,通过感知哈希去冗余确保多样性。其支撑的EVOLVE框架首次实现单模型跨数据集泛化与可变率编码,推动体数据压缩从领域特定优化迈向统一表示学习,在高压缩比下重建质量显著优于ZFP、SZ3等传统压缩器,对科学数据存储与传输具有里程碑意义。
当前挑战
当前挑战包括:1)领域问题层面,科学模拟数据生成速度远超存储网络带宽,传统误差有界压缩器(如ZFP、SZ3)在压缩比超1,000时失真严重,而隐式神经表示(如SIREN、NeurComp)需数小时逐体训练且固定压缩比,自动编码器方法跨数据集泛化能力弱;2)构建过程中,从9,921个体数据中筛选6,376个体时,需通过感知哈希和近邻相似度阈值(≥0.85)识别并移除冗余帧,防止模型过拟合局部模式;且面对异构科学领域数据分布,需引入线性预热等现代训练技巧以保证训练稳定性,同时设计基于上下文模型(3D棋盘空间与通道上下文)的熵编码以精准捕捉体素局部依赖性,最终实现高压缩比(如asteroids数据集达9,803×)与保真度平衡。
常用场景
经典使用场景
在科学可视化与数据分析的语境中,Cross-Domain Volume Database 为跨领域体数据的压缩与重建提供了至关重要的支撑。该数据库囊括了来自21个科学模拟项目的6,376个体数据,覆盖天体物理、气候科学、湍流燃烧等广泛领域,并通过感知哈希技术去除了冗余帧,确保了数据的高多样性。其最经典的使用场景在于作为训练和评估学习型体压缩模型的基准,使模型能够学习到跨体数据的通用特征,从而在未见过的同领域数据上实现高效压缩,无需针对每个体单独优化。
解决学术问题
该数据集的构建有效解决了学术界在高压缩比下体数据压缩的两个核心难题:传统压缩方法在压缩比超过1,000倍时难以保留精细结构,而基于隐式神经表示的方法则需要针对每个体数据和每种压缩比进行高成本的逐个优化。Cross-Domain Volume Database 通过提供大规模、多样化的训练样本,使得自编码器模型如 EVOLVE 能够学习到可迁移的特征表示,实现了单一模型对多领域未见数据的泛化压缩,同时支持连续可变比特率编码,显著提升了压缩效率与实用性。
衍生相关工作
围绕 Cross-Domain Volume Database,学术界已衍生出多项具有影响力的相关工作。论文 EVOLVE 本身作为基础框架,展示了在统一数据库上训练自编码器实现跨域体压缩的可行性。后续研究可在此基础上进一步探索更高效的上下文熵模型、引入时序信息以压缩时变数据,或将数据库扩展至医学及显微成像领域。此外,该数据库也为可视化分析任务提供了新工具,例如利用其潜在空间的 t-SNE 投影进行代表性时间步选择,推动了体数据分析方法的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务