遇见数据集

2024 MRSI Data Processing and Quantification Challenge Synthetic Dataset

收藏
arXiv2026-09-02 更新2026-09-04 收录
官方服务:

资源简介:

该数据集是由多所国际知名研究机构(包括慕尼黑工业大学、埃因霍温理工大学等)联合创建的2024年MRSI数据处理与量化挑战合成数据集,旨在为磁共振波谱成像方法提供可复现的受控基准测试平台。数据集包含32个受试者级别的子数据集(24个训练集和8个测试集),每个子数据集均包含受污染的FID-MRSI数据、解剖图像、B0场图、元数据以及已知真实值的代谢物和成分信号,共有384个时间采样点。创建过程基于人类连接组计划的高分辨率解剖图像和场图,通过前向模型模拟代谢物、大分子、残余水、脂质、基线和噪声等成分,并考虑空间编码和B0不均匀性效应。该数据集主要应用于MRSI处理方法、干扰信号去除算法和代谢物量化方法的开发与比较,解决了实验数据缺乏真实ground truth的难题,为算法评估提供可靠的基准。

This synthetic dataset for the 2024 MRSI Data Processing and Quantification Challenge was co-developed by multiple internationally leading research institutions, including the Technical University of Munich and Eindhoven University of Technology. It is designed to offer a reproducible, controlled benchmarking platform for magnetic resonance spectroscopic imaging (MRSI) methodologies. Comprising 32 subject-level subsets (24 training subsets and 8 test subsets), each subset contains contaminated FID-MRSI data with 384 temporal sampling points, anatomical images, B0 field maps, metadata, and metabolite and component signals with confirmed ground truth. The dataset is constructed using high-resolution anatomical images and field maps sourced from the Human Connectome Project (HCP). Forward models are utilized to simulate components including metabolites, macromolecules, residual water, lipids, baselines and noise, while accounting for spatial encoding and B0 inhomogeneity effects. This dataset is primarily applied to the development and comparison of MRSI processing methods, interference signal removal algorithms and metabolite quantification approaches. It resolves the challenge of lacking ground truth in experimental MRSI data, providing a reliable benchmark for algorithm evaluation.

创建时间:
2026-09-02
搜集汇总
数据集介绍
2024 MRSI Data Processing and Quantification Challenge Synthetic Dataset 数据集图片
构建方式
该数据集基于人类连接组计划(HCP)受试者的高分辨率解剖图像与场图,构建了模拟3T脑部FID-MRSI信号。其构建方法采用模块化前向模型,整合了量子力学模拟的代谢物基集、活体来源的大分子信号、Bloch模拟的残余水信号、非刚性配准的活体脂质信号、光谱基线及高斯噪声。尤为关键的是,水和脂质信号在高分辨率网格上合成后经k空间截断至目标矩阵,以模拟有限点扩散函数导致的空间泄漏。所有成分均在64×64×32网格上合成,并施加各体素频率偏移与Voigt线型展宽,最终生成包含24例训练与8例测试数据的综合资源。
特点
该数据集的核心特点在于其高度可控的现实性及完整的地面真值。它提供了空间变化的结构、场不均匀性、残余水和脂质污染等多种干扰,并针对每项成分提供了独立的地面真值信号。数据集中干扰信号强度被刻意放大以模拟极短TR/TE下的FID-MRSI采集,其峰值幅度超过代谢物幅度数千倍,极大挑战了处理算法的鲁棒性。此外,脂质信号通过k空间截断引入非局部污染,残余水幅度受B0场影响呈空间分布,且代谢物地面真值映射无吉布斯振铃现象。所有模拟参数均被完整记录,确保数据可重现并支持误差的体素级溯源。
使用方法
该数据集专为评估MRSI处理与量化方法而设计,可应用于两个子挑战。其一为污染数据上的干扰信号去除与代谢物量化,此场景中提供了水和脂质的干扰地面真值,用于评估算法在去除污染同时保持代谢物信号的能力。其二为洁净测试数据上的直接量化,用于评估基本量化性能。由于地面真值按成分和代谢物分别给出,并结合B0图与组织分数,误差可依组织类型、B0偏移和激发剖面进行分层分析。此外,数据可支持深度学习训练,但需注意训练集代谢物浓度固定,模型可能学习到固定的浓度先验,因此更适用于受控压力测试而非生物学变异性研究。
背景与挑战
背景概述
磁共振波谱成像(MRSI)作为一种能够无创探测脑内神经化学物质空间分布的技术,在脑代谢异质性研究中具有重要价值,但其数据的处理与定量分析因空间编码、组织部分容积效应及多种伪影的叠加而极具挑战。为应对此困境,2024年MRSI数据处理与量化挑战赛合成数据集应运而生,由来自慕尼黑工业大学、埃因霍温理工大学、杜克大学等多家机构的科研团队于2024年联合创建。该数据集基于人类连接组计划(HCP)的真实解剖影像与场图,通过精细的正向模型模拟了包括代谢物、大分子、残余水、脂质污染、基线及噪声在内的完整3T脑FID-MRSI信号,提供了24例训练与8例测试数据,并附有已知的代谢物浓度真值。这一资源的诞生,为MRSI数据处理、伪影去除及定量算法的可重复性评估提供了理想的标准测试平台,极大地推动了该领域方法学的严谨发展。
当前挑战
该数据集所面临的挑战是多维度的。在领域层面,其核心难点在于MRSI数据处理需同时应对剧烈的空间泄漏效应(如脂质信号从颅骨渗入脑实质)、场不均一性引起的谱线频移与展宽、残余水信号对代谢物谱的淹没,以及极低信噪比条件下的代谢物定量。构建过程中,团队亦需克服多重技术难题:如何将体内测量的脂质信号通过非刚性配准嵌入到不同受试者的解剖中,以模拟真实的空间污染;如何运用k空间截断重现有限点扩散函数导致的伪影,而非简单的插值模糊;以及如何依据HCP数据生成解剖结构真实且场图各异的个体化模板。此外,在代谢物浓度与弛豫时间的设定上,需整合并权衡多篇文献的数据,确保正向模型的合理性。这些挑战的解决,不仅体现了数据集的科学价值,也为未来合成数据的发展确立了严谨的标准。
常用场景
经典使用场景
该合成数据集在磁共振波谱成像领域最为经典的应用场景,是作为MRSI数据处理与代谢物定量方法的标准化基准测试平台。鉴于体内MRSI数据难以获取确凿的代谢物浓度金标准,此数据集通过提供含已知真值的模拟FID-MRSI信号,为开发与验证去噪、伪影去除、谱图拟合及定量重建等算法提供了理想的控制环境。其设计融入了受试者特异性的解剖结构与B0场不均匀性,模拟了残余水与脂质污染的空间泄漏效应,使得算法评估能在高度接近真实临床情境的条件下进行,从而客观衡量不同方法在复杂伪影干扰下的稳健性与精确度。
解决学术问题
此数据集直面MRSI领域长期存在的‘金标准缺失’这一核心学术痛点。传统上,由于无法直接观测体内真实的代谢物空间分布,算法性能的客观比较与可重复性验证始终是困扰研究者的难题。该数据集通过精细的正向模型模拟,生成了包含确切已知浓度的代谢物图谱和独立分量信号的资源,解决了合成数据失实与真实数据无标准之间的矛盾。它为系统性剖析算法在不同组织类型、不同B0偏共振条件以及不同强度伪影下的行为差异提供了量化工具,推动了数据驱动处理模型的可靠训练与验证,深刻促进了MRSI计算方法的严谨评估与跨研究对比。
衍生相关工作
以其公开可得的完整真值数据为依托,该数据集催生了一大批衍生的经典研究与应用工作。首要的是推动了旨在解决MRSI中显著脂质污染问题的空间-谱联合去除算法的迭代创新,例如基于低秩或深度学习的脂质抑制方法能在该框架下获得系统和可量化的评测。其次,它促进了针对极短回波时间谱中宏观分子信号与代谢物重叠进行精确建模和分离的研究前沿。围绕此数据集构建的标准化数据格式与报告规范,如带动NIfTI-MRS的推广,亦为未来合成磁共振波谱数据的设计与共享设立了参照基准,并启发了向更高场强(如7T)或多参数维度扩展的后续模拟工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务