IsoSynth
收藏官方服务:
资源简介:
IsoSynth生成真实的合成成像质谱(IMS)数据集,其中地面真实情况已知,用于严格、可重复的基准测试同位素检测和降维算法。生成器的每个参数都基于物理原理或从真实MALDI-timsTOF仪器测量中校准,没有任意魔法数字。
IsoSynth generates realistic synthetic imaging mass spectrometry (IMS) datasets with known ground truth for rigorous, reproducible benchmarking of isotope detection and dimensionality reduction algorithms. Each parameter of the generator is either physics-based or calibrated from measurements of real MALDI-timsTOF instruments, with no arbitrary "magic numbers".
创建时间:
2026-06-08
原始信息汇总
数据集概述:IsoSynth 🧬⚗️
IsoSynth 是一个基于物理原理的合成成像质谱(IMS)数据集生成工具,旨在为同位素体检测和降维算法提供严格的、可重复的基准测试。该数据集解决了真实 IM-IMS 数据缺乏真实标注(Ground Truth)的问题,通过模拟数据生成过程,精确知道每个峰所属的家族(Isotopologue Family),从而可以无歧义地计算精确率、召回率和 F1 分数。
核心物理原理
IsoSynth 的生成器基于三个物理事实:
- ¹³C 同位素质量间距:连续同位素峰(M+0, M+1, M+2...)之间的质量差为精确的 1.003355 Da(基于 ¹²C 和 ¹³C 的质量差)。
- 二项式 ¹³C 丰度模型:假设分子中有 N 个碳原子,出现 k 个 ¹³C 的概率服从二项分布(p=0.0107)。对于含有 34 个碳的典型脂质,M+0 / M+1 / M+2 的相对丰度为 1.000 / 0.384 / 0.071。
- 同位素体漂移时间不变性:由于 ¹²C 和 ¹³C 的替换对分子体积影响极小,同一分子的所有同位素体具有相同的碰撞截面(CCS),因此在离子迁移谱(IMS)中共享相同的漂移时间(drift-time-bin, dtb)。
数据集特性
- 基础数据集:生成包含多个(默认8个)同位素体家族(Isotopologue Family)的模拟数据。每个家族内,M+0、M+1、M+2 峰具有相同的空间分布和漂移时间。
- 混淆基准(Confounded Benchmark):提供可选的混淆条件,添加了“诱饵峰对”。这些诱饵峰对具有与真实家族相同的 m/z 间距(1.003355 Da)和相同的空间分布,但漂移时间相差 600 个 bin。此设计用于测试算法是否具备漂移时间滤波能力。仅依赖空间和 m/z 信息的方法无法区分它们,而结合 dtb 信息的方法可以轻松拒绝这些诱饵。
数据生成与使用
- 安装与依赖:通过
git clone下载,并运行pip install -r requirements.txt安装依赖(纯 Python + NumPy)。 - 快速启动:通过
generate_synthetic_ims()函数生成数据集。返回的SyntheticIMSDataset对象包含数据矩阵、m/z 轴、dtb 轴、真实家族标签及空间图谱。 - 主要参数(
generate_synthetic_ims()函数):nx,ny:图像宽度和高度(像素,默认 80x25)。n_families:同位素体家族数量(默认 8)。n_carbons_range:碳原子数范围(默认 34-48)。dtb_intra_noise:家族内部 dtb 抖动(默认 8.0 bins)。n_confound_per_family:每个家族的诱饵对数(默认 0,即无混淆)。
- 辅助函数:
binomial_isotope_profile(n_carbons, n_peaks)用于计算给定碳原子数和峰数的理论同位素丰度。
评估协议
数据集提供了基于 IoU(交并比)的评估标准示例:
- 使用
generate_synthetic_ims()生成数据集,获取真实家族标签gt_families。 - 运行用户的检测方法,得到预测的家族分组
predicted_families。 - 计算每个预测家族与所有真实家族的 IoU,如果最大 IoU >= 0.5,则视为正确检测。
- 计算精确率(Precision)、召回率(Recall)和 F1 分数。
搜集汇总
数据集介绍

构建方式
IsoSynth是一个基于物理原理构建的合成数据集,用于离子迁移成像质谱(IM-IMS)的同位素检测算法基准测试。其构建方式核心在于模拟实际质谱仪的数据生成过程:首先,依据¹²C与¹³C之间精确的1.003355 Da质量间距设定同位素峰位置;其次,采用二项分布模型计算给定碳原子数(如34至48个碳)下的M+0、M+1、M+2等峰的相对丰度;最后,依据离子迁移谱中同位素体具有相同碰撞截面的物理事实,将所有同位素峰分配至相同的漂移时间箱(dtb centroid)内,并加入校准于真实仪器噪声的8个bin高斯抖动。此外,数据集还包含背景峰和可选的混淆条件,通过在正确m/z间距但dtb差异达600 bin的位置设置诱饵峰,来评估算法对迁移时间信息的利用能力。
使用方法
使用IsoSynth数据集非常简便,通过纯Python和NumPy即可完成。用户通过pip安装后,调用`generate_synthetic_ims()`函数可一键生成包含指定像素数(如80×25)、同位素族数量(如8个)及背景峰数的模拟数据,并通过`seed`参数确保结果可重复。返回的`SyntheticIMSDataset`对象提供数据集矩阵X、m/z与dtb坐标及家族成员映射关系。评估算法时,用户需实现自己的检测方法,通过比较预测的同位素家族与`get_ground_truth()`输出的真实家族,使用交并比(IoU)大于0.5作为匹配标准,即可计算精确率、召回率和F1分数。此外,用户可设定`n_confound_per_family`参数生成混淆场景,专门测试算法对漂移时间信息的敏感度。
背景与挑战
背景概述
IsoSynth是一个由Meenakshi M于2026年创建的物理学引导的合成基准数据集,旨在解决离子迁移成像质谱(IM-IMS)中同位素峰检测与降维算法的可重复性评估难题。该数据集由研究者基于MALDI-timsTOF仪器的真实测量参数校准,严格遵循碳-13同位素质量间距(1.003355 Da)、二项式丰度模型及同位素体漂移时间不变性等物理原理生成。其核心创新在于提供已知真实标签的合成数据,填补了真实IM-IMS数据集因缺乏标注而无法直接度量算法准确性的空白,为相关领域建立了严格的性能评估标准。
当前挑战
该数据集应对的领域挑战在于:真实IM-IMS数据缺乏同位素峰归属的精确标签,传统方法仅能通过空间一致性或谱图合理性间接评估,无法精确计算查准率、查全率与F1分数。构建过程中的挑战则包括:需精确模拟碳-13同位素以1.003355 Da非整数间距分布、基于碳原子数的二项式丰度模型计算峰强度、并确保同位素体在离子迁移谱中共享相同的碰撞截面(CCS),同时引入漂移时间抖动以拟合真实仪器噪声。此外,设计混淆条件时需构造具有正确质荷比间距但漂移时间偏移600 bins的虚假峰对,以暴露仅依赖空间与质荷比信息的算法局限性。
常用场景
经典使用场景
在成像质谱分析领域,同位素峰团的准确识别是数据解析的核心挑战之一。IsoSynth作为首个基于物理定律的合成基准数据集,为离子淌度成像质谱(IM-IMS)中的同位素体检测与降维算法提供了黄金标准。通过严格模拟¹³C同位素质量间距(1.003355 Da)、二项式丰度模型以及同位素体淌度时间不变性,该数据集生成具有已知真实标签的合成数据,使得研究者能够无歧义地评估算法在峰值分组任务中的精确率、召回率与F1分数。其经典使用场景包括:在包含干扰对(Confounded)的复杂条件下,对比仅依赖空间共定位与质荷比间隔的算法与融合离子淌度信息的算法在抗干扰能力上的显著差异。
解决学术问题
IsoSynth从根本上解决了IM-IMS数据缺乏真实标注的长期瓶颈。在真实实验中,由于无法手工标注各质谱峰所属的分子家族,研究者只能通过内部一致性(如空间连贯性)间接评估算法性能,这种间接度量无法揭示算法在物理化学层面的正确性。该数据集通过引入受物理约束的合成数据,首次实现了对同位素体检测算法的绝对量化评价。其设计的干扰基准条件(Confounded scenario)进一步暴露了仅基于空间与质荷比信息的算法在淌度维度缺失时的脆弱性,为学术界提供了一个区分算法层级(是否利用离子淌度信息)的严格实验框架,从而推动了IM-IMS数据分析方法从经验验证向物理可解释性范式的跨越。
实际应用
在实际科研应用中,IsoSynth主要服务于质谱成像算法开发者和生物医学研究团队。对于从事脂质组学、代谢组学及蛋白质组学的实验室,该数据集可作为标准测试床,用于验证其自主研发的同位素峰检测流水线在复杂生物组织模拟环境中的稳健性。例如,在解析结肠组织切片中不同细胞类型(上皮、基质、肌肉)的分子组成时,研究者可利用IsoSynth预先筛选出最能抵抗噪声与淌度偏移的算法,从而提升真实实验数据中代谢物空间分布的解析精度。此外,制药企业可借助该基准评估数据处理平台的批次一致性,确保临床前样本中同位素标记示踪剂的检测可靠性。
数据集最近研究
最新研究方向
IsoSynth通过物理驱动的合成数据生成范式,为离子迁移成像质谱(IM-IMS)中的同位素检测与降维算法提供了首个具备明确金标准(ground-truth)的基准测试平台。在当前质谱组学数据爆炸式增长且真实数据集缺乏人工标注的背景下,该数据集精准回应了算法评估中“正确性”难以度量的核心困境。其最新研究聚焦于利用C13同位素的精确质量偏移(1.003355 Da)、二项分布丰度模型及漂移时间不变性三大物理法则,构建出无参数依赖的合成数据。尤为前沿的是,通过引入混淆实验(Confounded benchmark),该数据揭示仅依赖质荷比(m/z)与空间共定位的算法在面对离子迁移维度干扰时的脆弱性,从而推动算法领域向融合漂移时间一致性检验的多模态策略演进。这一设计不仅为MICCAI等计算病理学顶级会议关注的空间代谢组学分析提供了方法论验证基石,更可能重塑质谱成像中特征提取与分子成像的标准评估框架。
以上内容由遇见数据集搜集并总结生成



