BenchRep-T
收藏资源简介:
BenchRep-T是一个用于T细胞受体β链(TCRβ)免疫组库分类的基准数据集。它整合了一个多疾病队列(Mal-ID)和四个在Adaptive Biotechnologies immunoSEQ平台上测序的外部疾病队列,为每个样本提供组库文件、统一的样本元数据以及用于测序深度缩放定律实验和驱动序列实验的辅助文件。每个样本(一个测序的免疫组库)构成一个数据示例,分类目标是样本级别的疾病标签。数据集总规模在1K到10K之间,具体包含五个独立队列:Mal-ID(550个样本,涵盖健康/背景、HIV、狼疮、Covid19、流感和T1D多疾病分类)、Savola_RA(91个样本,类风湿关节炎vs健康)、Musvosvi_TB(140个样本,结核病进展者vs控制者)、Rawat_T1D(614个样本,1型糖尿病vs对照)和Mitchell_T1D(196个样本,1型糖尿病vs健康)。核心数据文件包括每个样本的TCRβ克隆/重排表(.tsv.gz压缩文件)、包含分类标签和队列特定注释的元数据表(.tsv文件),以及用于实验的预计算索引和已知公共/抗原特异性TCR匹配文件。组库文件的模式因队列而异:Mal-ID采用AIRR风格格式(约120列),包含完整的核苷酸比对信息;其他immunoSEQ队列采用约54列的导出格式;Rawat_T1D为简化的17列格式。元数据文件共享参与者标签、样本标签和疾病标签等核心列,并包含队列特定的临床、人口统计学或测序统计信息。该数据集适用于免疫组库机器学习、疾病生物标志物发现、TCR序列分析等任务,并支持跨队列的基准测试。
BenchRep-T is a benchmark dataset for T-cell receptor beta chain (TCRβ) immune repertoire classification. It integrates a multi-disease cohort (Mal-ID) and four external disease cohorts sequenced on the Adaptive Biotechnologies immunoSEQ platform, providing each sample with repertoire files, unified sample metadata, and auxiliary files for sequencing depth scaling law experiments and driver sequence experiments. Each sample (a sequenced immune repertoire) constitutes a data instance, with the classification target being the sample-level disease label. The total scale of the dataset ranges from 1K to 10K, and it contains five independent cohorts: Mal-ID (550 samples, covering multi-disease classification including healthy/background, HIV, lupus, Covid19, influenza, and T1D), Savola_RA (91 samples, rheumatoid arthritis versus healthy controls), Musvosvi_TB (140 samples, tuberculosis progressors versus controllers), Rawat_T1D (614 samples, type 1 diabetes versus controls), and Mitchell_T1D (196 samples, type 1 diabetes versus healthy controls). Core data files include TCRβ clone/rearrangement tables for each sample (compressed .tsv.gz files), a metadata table (.tsv file) containing classification labels and cohort-specific annotations, as well as precomputed indexes and known public/antigen-specific TCR matching files for experimental use. The repertoire file formats vary across cohorts: Mal-ID adopts the AIRR-style format (approximately 120 columns) with complete nucleotide alignment information; other immunoSEQ cohorts use an export format with approximately 54 columns; Rawat_T1D employs a simplified 17-column format. Metadata files share core columns such as participant ID, sample ID, and disease label, and include cohort-specific clinical, demographic, or sequencing statistical information. This dataset is suitable for tasks including immune repertoire machine learning, disease biomarker discovery, and TCR sequence analysis, and supports cross-cohort benchmarking.
BenchRep-T 数据集概述
BenchRep-T 是一个用于 TCRβ(T细胞受体β链)免疫组库分类 的基准数据集。它整合了多疾病 Mal-ID 队列与四个外部疾病队列(均基于Adaptive Biotechnologies的 immunoSEQ 平台测序),提供每个样本的组库文件、统一的样本元数据,以及用于测序深度标度律和驱动序列实验的辅助文件。
每个 样本(specimen)(一个测序组库)作为一个实例,分类目标是样本级别的 disease 标签。
数据集结构
BenchRep-T/ ├── Mal-ID/ │ ├── metadata.tsv # 550个样本标注与标签 │ ├── repertoires/ # 550个样本的TCRβ重排表 (.tsv.gz) │ ├── scaling_exp_depth_indices_max75k.json.gz # 深度标度律实验的采样索引 │ └── vdjdb_minervina_driver_seq_matches.csv # 组库与公共/驱动克隆匹配结果 └── immunoSEQ/ ├── Savola_RA/ # 类风湿关节炎 │ ├── metadata.tsv │ └── repertoires/ # 91个 .tsv.gz ├── Musvosvi_TB/ # 结核病(进展) │ ├── metadata.tsv │ └── repertoires/ # 140个 .tsv.gz ├── Rawat_T1D/ # 1型糖尿病 │ ├── metadata.tsv │ └── repertoires/ # 614个 .tsv.gz └── Mitchell_T1D/ # 1型糖尿病 ├── metadata.tsv └── repertoires/ # 196个 .tsv.gz
队列信息
| 队列 | 路径 | 分类任务 | 组库数 | 标签组成 | 组库格式 | 来源研究 |
|---|---|---|---|---|---|---|
| Mal-ID | Mal-ID/ |
多疾病 vs. 健康/背景 | 550 | 健康/背景 197, HIV 98, 狼疮 64, Covid19 58, 流感 37, T1D 96 | AIRR风格重排表 | Zaslavsky et al. 2025 |
| Savola_RA | immunoSEQ/Savola_RA/ |
类风湿关节炎 vs. 健康 | 91 | RA 71, 健康 20 | immunoSEQ导出 | Savola et al. 2017 |
| Musvosvi_TB | immunoSEQ/Musvosvi_TB/ |
结核进展者 vs. 控制者 | 140 | 进展者 63, 控制者 77 | immunoSEQ导出 | Musvosvi et al. 2023 |
| Rawat_T1D | immunoSEQ/Rawat_T1D/ |
1型糖尿病 vs. 对照 | 614 | T1D 426, 健康/背景 188 | immunoSEQ导出(精简版) | Rawat et al. 2026 |
| Mitchell_T1D | immunoSEQ/Mitchell_T1D/ |
1型糖尿病 vs. 健康 | 196 | T1D 171, 健康/背景 25 | immunoSEQ导出 | Mitchell et al. 2022 |
文件说明
repertoires/*.tsv.gz— 每个样本一个gzip压缩、制表符分隔的文件;每一行代表一个TCRβ克隆/重排。文件名是样本标识符(immunoSEQ队列中与对应元数据中的specimen_label/sample_name/filename列一致;Rawat_T1D文件名带有_TCRB后缀)。metadata.tsv— 每行对应一个样本,包含分类标签和各队列的注释(不同队列的字段模式不同)。Mal-ID/scaling_exp_depth_indices_max75k.json.gz— 预计算的读取采样索引(每个样本最多75,000条读取),用于测序深度标度律实验中的子采样组库。Mal-ID/vdjdb_minervina_driver_seq_matches.csv— 组库克隆与已知公共/抗原特异性“驱动”TCR(来自VDJdb和Minervina等)的匹配结果。列包括:disease, sample_cdr3, sample_vgene, sample_jgene, public_clone_cdr3, public_clone_vgene, public_clone_jgene, similarity, score, filename。
组库模式
- Mal-ID(AIRR风格,约120列):关键字段包括
sequence_id, repertoire_id, locus, v_call, d_call, j_call, cdr3, cdr3_aa, junction, junction_aa, productive, participant_label, specimen_time_point,以及完整的核苷酸比对/插入删除列。 - immunoSEQ队列(Savola_RA, Musvosvi_TB, Mitchell_T1D;Adaptive immunoSEO导出,约54列):关键字段包括
nucleotide, cdr3_aa, count (templates/reads), frequencyCount (%), v_call, j_call, vGeneName, jGeneName, sequenceStatus, estimatedNumberGenomes, sequence, num_reads, repertoire_id, participant_label。 - Rawat_T1D(精简版immunoSEQ导出,17列):包括
cdr3_aa, count (templates/reads), frequency, nucleotide, v_call, d_gene, j_call, sequenceStatus, v_family, d_family, j_family, v_resolved, d_resolved, j_resolved, sequence, num_reads。
元数据模式
所有 metadata.tsv 文件都包含 participant_label、specimen_label 和 disease(分类目标列)。每个队列提供交叉验证折分配(CV_fold / fold / malid_cross_validation_fold_id_when_in_test_set)。各队列额外列包括:
- Mal-ID / Mitchell_T1D:
specimen_time_point, study_name, available_gene_loci, disease_subtype, age, sex, ancestry。 - Savola_RA / Musvosvi_TB:immunoSEQ样本统计量(
total_templates, productive_templates, fraction_productive, productive_simpson_clonality, sample_tags, sku, test_name等)。 - Rawat_T1D:受试者临床/HLA字段(
diabetes_status, sex, age, duration, HLA A/B/C/DPB1/DQB1/DRB1…, hla_high_risk_type, autoantibody statuses, ML_class)。
许可
采用 MIT许可证 发布。




