Bulk-RNA-Seq-Benchmark
收藏资源简介:
该数据集是一个用于评估基础模型的批量 RNA-seq 基准测试,源自 38 个公开数据集,整合为 58 个预测任务(25 个回归任务,33 个分类任务)。任务涵盖临床结果预测(如治疗反应、复发、生存期、药物敏感性、分期和分子表型)以及诊断预测(如疾病/感染存在与否或类型)。每个数据集以 Parquet 文件格式存储,每行代表一个样本,包含样本标识符(sample_id)、基因表达矩阵(基因符号列,log1p 尺度,非负)、任务标签列(y__<task>,NaN 表示该样本不属于该任务)以及可选的交叉验证分组键(group__<task>,用于需要按患者/供体分组的数据集)。数据规模从少量样本(n≤100)到数千样本不等,例如 GTEx 的端粒长度任务(n=3940)和 TCGA 的癌症分期任务(n=5206)。该基准测试特别适用于评估基础模型在转录组学数据上的泛化能力,并提供了标准化的加载和交叉验证流程。
This dataset is a batch RNA-seq benchmark for evaluating foundation models, derived from 38 public datasets, consolidated into 58 prediction tasks (25 regression tasks, 33 classification tasks). The tasks cover clinical outcome prediction (e.g., treatment response, recurrence, survival, drug sensitivity, staging, and molecular phenotypes) and diagnostic prediction (e.g., presence/absence or type of disease/infection). Each dataset is stored in Parquet file format, with each row representing a sample, containing sample identifier (sample_id), gene expression matrix (gene symbol columns, log1p scale, non-negative), task label column (y__<task>, NaN indicates the sample does not belong to the task), and optional cross-validation grouping key (group__<task>, used for datasets requiring grouping by patient/donor). Data sizes range from small samples (n≤100) to thousands, e.g., GTEx telomere length task (n=3940) and TCGA cancer staging task (n=5206). This benchmark is particularly suitable for evaluating the generalization ability of foundation models on transcriptomics data, and provides standardized loading and cross-validation workflows.
数据集概述
Bulk-RNA-Seq-Benchmark 是一个用于基础模型评估的批量 RNA 测序(Bulk RNA-seq)基准数据集,包含 58 个任务(25 个回归任务,33 个分类任务),覆盖 38 个数据集,领域涉及临床结局预测、诊断以及生物学/药理学表型分析。
数据格式
- 每个数据集对应
data/目录下的一个 Parquet 文件。 - 每一行代表一个样本,列包括:
sample_id:样本编号(如 GSM 编号、细胞系或供体 ID)。- 基因列:原生表达矩阵,以基因符号为列名。
y__<task>:每个任务对应的标签列,NaN 表示该样本不属于该任务的队列。任务复现时需筛选该列非 NaN 的行。group__<task>:用于分组交叉验证(如供体/患者)的分组键。
- 所有表达数据均为 log1p 尺度,非负值:大部分为 log1p-CPM,GTEx 为 log1p,CMP 和 GSE81538 从原始线性 TPM/log2 尺度转换而来。
数据加载示例
python import pandas as pd df = pd.read_parquet("data/CMP.parquet") y = df["y__ic50_Bortezomib"] mask = y.notna() X = df.loc[mask, [c for c in df.columns if not c.startswith(("y__", "group__", "sample_id"))]] y = y[mask]
交叉验证分割
大部分数据集每个受试者只有一个样本,可随机分割。以下数据集包含同一患者/供体的多个样本,必须使用 group__<task> 列进行分组分割(如 GroupKFold / StratifiedGroupKFold),避免同受试者跨折泄漏:
BeatAML、CPTAC、GSE107995、GSE156902、GSE157657、GSE193677、GSE243375、GSE278476、GSE279480、GTEx、TARGET、TCGA。
python from sklearn.model_selection import GroupKFold groups = df.loc[mask, "group__ajcc_stage_4"] for tr, te in GroupKFold(5).split(X, y, groups): ...
任务目录
A 类——临床与生物学结局预测
涵盖治疗反应、复发、生存、药物敏感性、分期及分子表型。
小型任务(n ≤ 100)
以下 16 个数据集各包含 1 个任务,任务类型包括分类(如 systemic_recurrence、relapse、chemo_response 等)和回归(如 prednisolone_lc50、hospital_free_days),样本量从 30 到 99 不等,涉及结直肠癌、白血病、肺癌、膀胱癌、卵巢癌、COVID-19、结核病、类风湿关节炎、黑色素瘤、前列腺癌等疾病。
中型任务(n > 100)
以下 12 个数据集包含 1 至 10 个任务不等:
- BeatAML:10 个回归任务,预测 10 种靶向药物的体外药物敏感性(AUC),样本量 277 至 492。
- CMP:10 个回归任务,预测 10 种不同作用机制药物的 IC50,样本量 1177 至 1202。
- GSE109142:1 个分类任务,预测小儿溃疡性结肠炎第 4 周临床缓解,n=198。
- GSE112927:1 个分类任务,预测移植肾丢失,n=235。
- GSE163882:1 个分类任务,预测乳腺癌新辅助化疗病理完全缓解(pCR),n=217。
- GSE185263:1 个分类任务,预测脓毒症院内死亡率,n=345。
- GSE193677:1 个分类任务,预测 IBD 组织学缓解,n=1301。
- GSE243375:1 个分类任务,预测 HER2+ 乳腺癌新辅助治疗 pCR,n=242。
- GSE51799:1 个回归任务预测 CAG 重复数,1 个分类任务预测突变携带状态,n=124。
- GSE93624:1 个分类任务,预测小儿克罗恩病 3 年复杂进展,n=245。
- GSE175718:1 个 4 分类任务,区分肾移植排斥类型,n=234。
- GSE107995:1 个 4 分类任务,预测结核病未来状态,n=414。
B 类——诊断预测
从转录组预测疾病/感染存在或类型。
共计 11 个数据集:
- CPTAC:分类任务,预测 AJCC 病理分期(I–IV),n=2464。
- GSE156902:4 分类任务,区分 GBM/脑转移/多发性硬化/对照,n=642。
- GSE234297:分类任务,ALS vs 健康诊断,n=144。
- GSE234587:分类任务,疟疾寄生虫血症 +/−,n=33。
- GSE279480:分类任务,CMV 血清状态,n=255。
- GSE51799:分类任务,亨廷顿病突变携带状态,n=124。
- GSE68086:7 分类任务,泛癌类型 vs 健康,n=246。
- GTEx:回归任务,预测端粒长度,n=3940。
- TARGET:分类任务,小儿神经母细胞瘤 INSS 分期,n=158。
- TCGA:分类任务,泛癌(33 种)AJCC 病理分期,n=5206。
- GSE81538:回归任务,预测 Ki67 增殖指数,n=405。




