遇见数据集

Simulated multi-omics datasets based on ovarian cancer (generated with InterSIM R library)

收藏
Zenodo2026-02-01 更新2026-05-26 收录
官方服务:

资源简介:

This dataset contains synthetic multi-omics data generated using the InterSIM R package. The simulations produce three omics layers, gene expression, DNA methylation, and protein expression, with cluster overlap controlled by an "effect size" parameter. Each simulation is parameterised by a random seed (controlling reproducibility) and an effect size (controlling the degree of separation between clusters). Twenty effect sizes are tested per seed, ranging from 0.1 (minimal cluster separation) to 2.0 (maximal cluster separation) in increments of 0.1. A total of 30 seeds are used (43–62 and 73–82), yielding 600 simulation combinations in total. File contents expr.csv — Simulated gene expression data matrix (samples × genes). methyl.csv — Simulated DNA methylation data matrix (samples × CpG sites). protein.csv — Simulated protein abundance data matrix (samples × proteins). labels.csv — Cluster membership labels assigned to each sample by the simulation. pca_expr.png — PCA plot of the gene expression layer. pca_methyl.png — PCA plot of the DNA methylation layer. pca_protein.png — PCA plot of the protein abundance layer. Each PCA plot visualises the cluster structure induced by the specified effect size for the corresponding omics layer. Folder structure root/ ├── seed43/ │ ├── effect_0.1/ │ │ ├── expr.csv │ │ ├── labels.csv │ │ ├── methyl.csv │ │ ├── protein.csv │ │ ├── pca_expr.png │ │ ├── pca_methyl.png │ │ └── pca_protein.png │ ├── effect_0.2/ │ │ ├── expr.csv │ │ ├── labels.csv │ │ ├── methyl.csv │ │ ├── protein.csv │ │ ├── pca_expr.png │ │ ├── pca_methyl.png │ │ └── pca_protein.png │ ├── ... │ └── effect_2.0/ │ ├── expr.csv │ ├── labels.csv │ ├── methyl.csv │ ├── protein.csv │ ├── pca_expr.png │ ├── pca_methyl.png │ └── pca_protein.png ├── seed44/ │ └── ... ├── ... ├── seed62/ │ └── ... ├── seed73/ │ └── ... └── seed82/ └── ... Generation All data were simulated using the InterSIM package in R. Chalise P, Raghavan R, Fridley BL. InterSIM: Simulation tool for multiple integrative 'omic datasets'. Comput Methods Programs Biomed. 2016 May;128:69-74. doi: 10.1016/j.cmpb.2016.02.011. Epub 2016 Feb 27. PMID: 27040832; PMCID: PMC4833453. License CC0 1.0 Universal (public domain dedication)

本数据集包含使用InterSIM R包生成的合成多组学数据。该模拟可生成三类组学层面数据:基因表达、DNA甲基化以及蛋白质表达,且类簇间的重叠程度可通过“效应量(effect size)”参数进行控制。 每项模拟均通过随机种子(random seed,用于控制可复现性)与效应量(effect size,用于控制类簇间的分离程度)进行参数化设置。每个随机种子将测试20个不同的效应量,取值范围为0.1(最小类簇分离度)至2.0(最大类簇分离度),步长为0.1。本次实验共使用30个随机种子(43–62与73–82),总计生成600组模拟组合。 文件说明 expr.csv — 模拟基因表达数据矩阵(样本×基因)。 methyl.csv — 模拟DNA甲基化数据矩阵(样本×CpG位点)。 protein.csv — 模拟蛋白质丰度数据矩阵(样本×蛋白质)。 labels.csv — 模拟过程为每个样本分配的类簇成员标签。 pca_expr.png — 基因表达层面的主成分分析(PCA)可视化图。 pca_methyl.png — DNA甲基化层面的主成分分析可视化图。 pca_protein.png — 蛋白质丰度层面的主成分分析可视化图。 每张主成分分析图均可视化了对应组学层面由指定效应量诱导产生的类簇结构。 文件夹结构 root/ ├── seed43/ │ ├── effect_0.1/ │ │ ├── expr.csv │ │ ├── labels.csv │ │ ├── methyl.csv │ │ ├── protein.csv │ │ ├── pca_expr.png │ │ ├── pca_methyl.png │ │ └── pca_protein.png │ ├── effect_0.2/ │ │ ├── expr.csv │ │ ├── labels.csv │ │ ├── methyl.csv │ │ ├── protein.csv │ │ ├── pca_expr.png │ │ ├── pca_methyl.png │ │ └── pca_protein.png │ ├── ... │ └── effect_2.0/ │ ├── expr.csv │ ├── labels.csv │ ├── methyl.csv │ ├── protein.csv │ ├── pca_expr.png │ ├── pca_methyl.png │ └── pca_protein.png ├── seed44/ │ └── ... ├── ... ├── seed62/ │ └── ... ├── seed73/ │ └── ... └── seed82/ └── ... 数据生成 所有数据均通过R语言的InterSIM包进行模拟生成。 Chalise P, Raghavan R, Fridley BL. InterSIM: 面向多组学整合数据集的模拟工具. Comput Methods Programs Biomed. 2016 May;128:69-74. doi: 10.1016/j.cmpb.2016.02.011. Epub 2016 Feb 27. PMID: 27040832; PMCID: PMC4833453. 许可协议 CC0 1.0 Universal(公共领域贡献)

提供机构:
Zenodo
创建时间:
2026-02-01
二维码
社区交流群
二维码
科研交流群
商业服务