遇见数据集

BenchRep-T

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

BenchRep-T是一个用于T细胞受体β链(TCRβ)免疫组库分类的基准数据集。它整合了一个多疾病队列(Mal-ID)和四个在Adaptive Biotechnologies immunoSEQ平台上测序的外部疾病队列,为每个样本提供组库文件、统一的样本元数据以及用于测序深度缩放定律实验和驱动序列实验的辅助文件。每个样本(一个测序的免疫组库)构成一个数据示例,分类目标是样本级别的疾病标签。数据集总规模在1K到10K之间,具体包含五个独立队列:Mal-ID(550个样本,涵盖健康/背景、HIV、狼疮、Covid19、流感和T1D多疾病分类)、Savola_RA(91个样本,类风湿关节炎vs健康)、Musvosvi_TB(140个样本,结核病进展者vs控制者)、Rawat_T1D(614个样本,1型糖尿病vs对照)和Mitchell_T1D(196个样本,1型糖尿病vs健康)。核心数据文件包括每个样本的TCRβ克隆/重排表(.tsv.gz压缩文件)、包含分类标签和队列特定注释的元数据表(.tsv文件),以及用于实验的预计算索引和已知公共/抗原特异性TCR匹配文件。组库文件的模式因队列而异:Mal-ID采用AIRR风格格式(约120列),包含完整的核苷酸比对信息;其他immunoSEQ队列采用约54列的导出格式;Rawat_T1D为简化的17列格式。元数据文件共享参与者标签、样本标签和疾病标签等核心列,并包含队列特定的临床、人口统计学或测序统计信息。该数据集适用于免疫组库机器学习、疾病生物标志物发现、TCR序列分析等任务,并支持跨队列的基准测试。

BenchRep-T is a benchmark dataset for T-cell receptor beta chain (TCRβ) immune repertoire classification. It integrates a multi-disease cohort (Mal-ID) and four external disease cohorts sequenced on the Adaptive Biotechnologies immunoSEQ platform, providing each sample with repertoire files, unified sample metadata, and auxiliary files for sequencing depth scaling law experiments and driver sequence experiments. Each sample (a sequenced immune repertoire) constitutes a data instance, with the classification target being the sample-level disease label. The total scale of the dataset ranges from 1K to 10K, and it contains five independent cohorts: Mal-ID (550 samples, covering multi-disease classification including healthy/background, HIV, lupus, Covid19, influenza, and T1D), Savola_RA (91 samples, rheumatoid arthritis versus healthy controls), Musvosvi_TB (140 samples, tuberculosis progressors versus controllers), Rawat_T1D (614 samples, type 1 diabetes versus controls), and Mitchell_T1D (196 samples, type 1 diabetes versus healthy controls). Core data files include TCRβ clone/rearrangement tables for each sample (compressed .tsv.gz files), a metadata table (.tsv file) containing classification labels and cohort-specific annotations, as well as precomputed indexes and known public/antigen-specific TCR matching files for experimental use. The repertoire file formats vary across cohorts: Mal-ID adopts the AIRR-style format (approximately 120 columns) with complete nucleotide alignment information; other immunoSEQ cohorts use an export format with approximately 54 columns; Rawat_T1D employs a simplified 17-column format. Metadata files share core columns such as participant ID, sample ID, and disease label, and include cohort-specific clinical, demographic, or sequencing statistical information. This dataset is suitable for tasks including immune repertoire machine learning, disease biomarker discovery, and TCR sequence analysis, and supports cross-cohort benchmarking.

创建时间:
2026-07-24
原始信息汇总

BenchRep-T 数据集概述

BenchRep-T 是一个用于 TCRβ(T细胞受体β链)免疫组库分类 的基准数据集。它整合了多疾病 Mal-ID 队列与四个外部疾病队列(均基于Adaptive Biotechnologies的 immunoSEQ 平台测序),提供每个样本的组库文件、统一的样本元数据,以及用于测序深度标度律和驱动序列实验的辅助文件。

每个 样本(specimen)(一个测序组库)作为一个实例,分类目标是样本级别的 disease 标签。

数据集结构

BenchRep-T/ ├── Mal-ID/ │ ├── metadata.tsv # 550个样本标注与标签 │ ├── repertoires/ # 550个样本的TCRβ重排表 (.tsv.gz) │ ├── scaling_exp_depth_indices_max75k.json.gz # 深度标度律实验的采样索引 │ └── vdjdb_minervina_driver_seq_matches.csv # 组库与公共/驱动克隆匹配结果 └── immunoSEQ/ ├── Savola_RA/ # 类风湿关节炎 │ ├── metadata.tsv │ └── repertoires/ # 91个 .tsv.gz ├── Musvosvi_TB/ # 结核病(进展) │ ├── metadata.tsv │ └── repertoires/ # 140个 .tsv.gz ├── Rawat_T1D/ # 1型糖尿病 │ ├── metadata.tsv │ └── repertoires/ # 614个 .tsv.gz └── Mitchell_T1D/ # 1型糖尿病 ├── metadata.tsv └── repertoires/ # 196个 .tsv.gz

队列信息

队列 路径 分类任务 组库数 标签组成 组库格式 来源研究
Mal-ID Mal-ID/ 多疾病 vs. 健康/背景 550 健康/背景 197, HIV 98, 狼疮 64, Covid19 58, 流感 37, T1D 96 AIRR风格重排表 Zaslavsky et al. 2025
Savola_RA immunoSEQ/Savola_RA/ 类风湿关节炎 vs. 健康 91 RA 71, 健康 20 immunoSEQ导出 Savola et al. 2017
Musvosvi_TB immunoSEQ/Musvosvi_TB/ 结核进展者 vs. 控制者 140 进展者 63, 控制者 77 immunoSEQ导出 Musvosvi et al. 2023
Rawat_T1D immunoSEQ/Rawat_T1D/ 1型糖尿病 vs. 对照 614 T1D 426, 健康/背景 188 immunoSEQ导出(精简版) Rawat et al. 2026
Mitchell_T1D immunoSEQ/Mitchell_T1D/ 1型糖尿病 vs. 健康 196 T1D 171, 健康/背景 25 immunoSEQ导出 Mitchell et al. 2022

文件说明

  • repertoires/*.tsv.gz — 每个样本一个gzip压缩、制表符分隔的文件;每一行代表一个TCRβ克隆/重排。文件名是样本标识符(immunoSEQ队列中与对应元数据中的 specimen_label/sample_name/filename 列一致;Rawat_T1D文件名带有 _TCRB 后缀)。
  • metadata.tsv — 每行对应一个样本,包含分类标签和各队列的注释(不同队列的字段模式不同)。
  • Mal-ID/scaling_exp_depth_indices_max75k.json.gz — 预计算的读取采样索引(每个样本最多75,000条读取),用于测序深度标度律实验中的子采样组库。
  • Mal-ID/vdjdb_minervina_driver_seq_matches.csv — 组库克隆与已知公共/抗原特异性“驱动”TCR(来自VDJdb和Minervina等)的匹配结果。列包括:disease, sample_cdr3, sample_vgene, sample_jgene, public_clone_cdr3, public_clone_vgene, public_clone_jgene, similarity, score, filename

组库模式

  • Mal-ID(AIRR风格,约120列):关键字段包括 sequence_id, repertoire_id, locus, v_call, d_call, j_call, cdr3, cdr3_aa, junction, junction_aa, productive, participant_label, specimen_time_point,以及完整的核苷酸比对/插入删除列。
  • immunoSEQ队列(Savola_RA, Musvosvi_TB, Mitchell_T1D;Adaptive immunoSEO导出,约54列):关键字段包括 nucleotide, cdr3_aa, count (templates/reads), frequencyCount (%), v_call, j_call, vGeneName, jGeneName, sequenceStatus, estimatedNumberGenomes, sequence, num_reads, repertoire_id, participant_label
  • Rawat_T1D(精简版immunoSEQ导出,17列):包括 cdr3_aa, count (templates/reads), frequency, nucleotide, v_call, d_gene, j_call, sequenceStatus, v_family, d_family, j_family, v_resolved, d_resolved, j_resolved, sequence, num_reads

元数据模式

所有 metadata.tsv 文件都包含 participant_labelspecimen_labeldisease(分类目标列)。每个队列提供交叉验证折分配(CV_fold / fold / malid_cross_validation_fold_id_when_in_test_set)。各队列额外列包括:

  • Mal-ID / Mitchell_T1Dspecimen_time_point, study_name, available_gene_loci, disease_subtype, age, sex, ancestry
  • Savola_RA / Musvosvi_TB:immunoSEQ样本统计量(total_templates, productive_templates, fraction_productive, productive_simpson_clonality, sample_tags, sku, test_name 等)。
  • Rawat_T1D:受试者临床/HLA字段(diabetes_status, sex, age, duration, HLA A/B/C/DPB1/DQB1/DRB1…, hla_high_risk_type, autoantibody statuses, ML_class)。

许可

采用 MIT许可证 发布。

搜集汇总
数据集介绍
BenchRep-T 数据集图片
构建方式
BenchRep-T作为T细胞受体β链免疫组库分类的标准化基准,整合了来自多项研究的跨疾病队列数据。其核心为Mal-ID多疾病队列,涵盖550份包含HIV、狼疮、COVID-19等亚型的样本,并汇集了四个基于Adaptive Biotechnologies免疫SEQ平台的外部疾病队列,涵盖类风湿性关节炎、结核病进展及两种1型糖尿病亚型。数据以每个测序样本为单位,将TCRβ重排表存储为压缩的TSV文件,同时提供统一的样本元数据及用于测序深度标度律实验的采样索引文件和驱动序列匹配辅助文件。
特点
该数据集具有显著的跨队列异质性与标准化统一性。各队列遵循差异化的元数据模式,其中Mal-ID采用AIRR风格的大规模重排表,免疫SEQ队列则保留平台原生格式,而Rawat_T1D采用精简字段版本,这为探索不同数据模式下的模型鲁棒性提供了天然实验场。所有队列共享参与者、样本标识及疾病标签三个核心字段,并预分配了交叉验证折数,便于开展可复现的基准评估。此外,数据集内置了用于研究测序深度对分类性能影响的降采样索引,以及驱动序列匹配结果,支持深入探究免疫组库的生物学驱动机制。
使用方法
研究者可通过Hugging Face Hub的snapshot_download函数按需下载单个队列,例如利用allow_patterns参数仅获取免疫SEQ中类风湿性关节炎子集。获取本地数据后,使用Pandas的read_csv方法可直接解析gzip压缩的重排表文件,无需额外解压步骤。元数据与重排表通过样本标识符进行关联,而Mal-ID队列的降采样索引及驱动序列匹配文件则需通过json和csv模块分别加载,以复现特定实验分析。数据以MIT许可证开放,允许灵活应用于学术研究与模型开发。
背景与挑战
背景概述
BenchRep-T数据集由Zaslavsky等研究人员于2025年创建,是首个专门用于TCRβ免疫组库分类的综合基准测试集。该数据集整合了Mal-ID多疾病队列与四个外部疾病队列(涵盖类风湿性关节炎、结核病进展、1型糖尿病等),基于Adaptive Biotechnologies的immunoSEQ平台测序,包含1591个标本级别的TCRβ重排数据。其核心研究问题在于标准化免疫组库分析流程,推动基于T细胞受体序列的疾病诊断模型发展。作为该领域的里程碑式资源,BenchRep-T为探索测序深度缩放规律、驱动序列识别等前沿问题提供了标准化的评估平台,显著促进了机器学习方法在免疫组库分类研究中的应用。
当前挑战
该数据集面临的核心领域挑战在于:免疫组库的个体间高度异质性使得疾病分类模型难以泛化,不同疾病间共享的公共TCR克隆型又增加了分类边界模糊性。构建过程中面临多重技术挑战:各队列测序平台差异(AIRR格式与immunoSEQ格式)、metadata模式不统一、原始样本测序深度不等(需设计缩放实验标准化处理)。此外,Rawat_T1D队列的存储格式缩减导致部分关键信息缺失,Mal-ID队列的多疾病标签体系复杂,需构建层次化分类策略。最终数据集要求同时兼顾批次效应消除与生物学信号保持,这对后续建模方法提出了极高要求。
常用场景
经典使用场景
BenchRep-T作为TCRβ免疫组库分类的标准化基准,其最经典的应用场景在于评估和比较不同机器学习模型对免疫组库数据的疾病分类能力。研究者可利用该数据集统一的标本级别重排表格和元数据,训练分类器区分健康个体与多种疾病状态,包括HIV、系统性红斑狼疮、COVID-19、流感、类风湿关节炎、结核病进展以及1型糖尿病。该基准整合了Mal-ID多疾病队列与四个外部免疫SEQ平台队列,涵盖了不同测序深度和疾病谱系,为验证分类算法的泛化性与鲁棒性提供了可靠平台。通过固定的交叉验证折分配,研究者能够在完全可比条件下评估模型性能,推动免疫组库分析方法的标准化进程。
衍生相关工作
BenchRep-T的发布催生了一系列围绕免疫组库表示学习与疾病分类的方法学研究。其内置的测序深度缩放实验衍生了关于数据质量与模型规模幂律关系的工作,研究者通过在该基准上系统采样不同读段数,揭示了分类性能随测序深度增加的饱和特性。驱动序列匹配文件则推动了对公共TCR克隆作为疾病生物标志物可靠性的深入分析,衍生出基于抗原特异性模板的迁移学习方法。此外,多队列可比性设计催生了领域适应与跨平台泛化技术的研究,部分工作通过对比Mal-ID与免疫SEQ队列间的特征分布差异,开发了批次效应矫正算法。该基准已成为免疫组库深度学习领域方法性能对比的标尺。
数据集最近研究
最新研究方向
BenchRep-T作为TCRβ免疫组库分类的标准化基准,当前研究前沿聚焦于利用大规模多疾病队列的公开数据,探索基于T细胞受体库的机器学习诊断模型与免疫疾病泛化分类能力。该数据集整合了涵盖HIV、系统性红斑狼疮、COVID-19、类风湿关节炎、结核病、1型糖尿病等领域的数种免疫疾病队列,其核心价值在于支持跨队列的可重复性评估和深度测序影响分析。伴随Mal-ID研究的发表,该基准推动了对TCR序列特征在疾病早期筛查与亚型鉴别中应用的热点探索,尤其在解读驱动克隆与疾病特异性的关联、以及样本测序深度对分类性能影响的尺度定律实验方面。BenchRep-T的开放构建范式,不仅推动免疫组库数据标准化与模型可比较性进步,更有望为推进精准免疫诊断和传染病监视提供坚实的数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务