BioXArena-Data-Public-XL
收藏资源简介:
BioXArena-Data-Public-XL是BioXArena-XL的公共数据包,包含用于生物信息学AI代理开发和推理的公开数据。该数据集是原始BioXArena的更大规模变体,专注于更少但更重、更现实的任务。数据涵盖6个核心生物信息学领域:化学生物学、成像、网络生物学、序列基因组学、单细胞扰动和结构生物学,共包含39个具体任务。每个任务遵循统一的目录结构,包含任务描述文件、样本提交模板、训练/测试数据表以及模态特定的公开资产。数据集规模显著扩大,体现在:更大的队列和样本量、更广泛的来源覆盖(多个上游数据集、物种、细胞系等)、更难的泛化划分(保留药物、扰动、靶点等)、文件清单提交方式以及按来源/靶点/组织等分组的主要评估指标。具体数据规模方面,化学生物学领域平均每任务训练71,039行;成像领域15,944行;网络生物学领域863,856行;序列基因组学领域52,843行;单细胞扰动领域57,755行;结构领域69,157行。整个公共数据包大小约147GB。数据集适用于分子属性预测、图像分割与分类、基因调控网络推断、基因组学任务、单细胞分析和蛋白质结构预测等多种生物信息学AI任务。
BioXArena-Data-Public-XL is the public data package of BioXArena-XL, containing publicly available data for bioinformatics AI agent development and inference. This dataset is a larger-scale variant of the original BioXArena, focusing on fewer but heavier and more realistic tasks. The data covers 6 core bioinformatics domains: chemical biology, imaging, network biology, sequence genomics, single-cell perturbation, and structural biology, comprising a total of 39 specific tasks. Each task follows a unified directory structure, including task description files, sample submission templates, training/test data tables, and modality-specific public assets. The dataset scale is significantly expanded, reflected in: larger cohorts and sample sizes, broader source coverage (multiple upstream datasets, species, cell lines, etc.), harder generalization splits (retaining drugs, perturbations, targets, etc.), file list submission methods, and main evaluation metrics grouped by source/target/tissue, etc. In terms of specific data scale, the chemical biology domain averages 71,039 rows per task; imaging domain 15,944 rows; network biology domain 863,856 rows; sequence genomics domain 52,843 rows; single-cell perturbation domain 57,755 rows; and structural domain 69,157 rows. The entire public data package size is approximately 147GB. The dataset is suitable for various bioinformatics AI tasks such as molecular property prediction, image segmentation and classification, gene regulatory network inference, genomics tasks, single-cell analysis, and protein structure prediction.
BioXArena-Data-Public-XL 数据集概述
基本信息
该数据集是 BioXArena-XL 的公开数据包,包含智能体在开发和推理过程中使用的公开输入、任务描述和样本提交模板。私有标签存储在匹配的 BioXArena-Data-Private-XL 包中。
数据规模
- 领域数量:6 个
- 任务总数:39 个
- 公开数据包大小:147 GB
- 对比原始 BioXArena:原始包 105 GB,9 个领域,76 个任务
各领域任务数量
| 领域 | 任务数 |
|---|---|
| chemical-biology | 7 |
| imaging | 7 |
| network-biology | 4 |
| sequence-genomics | 6 |
| single-cell-perturbation | 6 |
| structure | 9 |
数据目录结构
每个任务遵循以下顶层布局:
BioXArena-Data-Public-XL/
-- <domain>/ -- <task>/
-- public/ |-- description.md |-- sample_submission.csv |-- train.csv |-- test.csv -- modality-specific public assets
各任务核心文件
- public/description.md:任务描述
- public/sample_submission.csv:样本提交模板
- public/train.csv:训练集
- public/test.csv:测试集
- 特定模态的公开资产:因任务而异(如显微镜图像、分割输入、扰动-响应特征、冷冻电镜体积、分子/结构特征、序列元数据、临床协变量、多模态组学特征)
XL 版本的核心差异
BioXArena-XL 是一个精心策划的更大规模变体,具有以下特点:
- 更大的队列/样本/测试项:每任务更多样本
- 更广泛的来源覆盖:如多个上游数据集、物种、细胞系、靶点、检测家族、组织或癌症队列
- 更难泛化分割:如保留药物、扰动、靶点、复合物、来源或OOD化学
- 文件清单提交:
submission.csv引用生成的数组、掩码或体积,而非将所有预测存储为标量 CSV 字段 - 分组主指标:按来源、靶点、复合物、组织、癌症队列、细胞系或PDB条目评估性能
各领域 XL 规模信号
Chemical-Biology
- 7 个任务,平均训练 71,039 行/任务,平均测试 17,542 行/任务
- 包含 BOOM-XL-CSD、ChemCoT-XL、Chemixhub-XL、Solubility-XL、TDC-XL 系列任务
- 公开大小:195 MB
Imaging
- 7 个任务,平均训练 15,944 行/任务,平均测试 3,986 行/任务
- 包含 CellSAM-XL、CryoCRAB-XL、DrugClass-XL、STARC-9-XL、SubCell-XL、SurvPath-XL 系列任务
- 公开大小:30 GB
Network-Biology
- 4 个任务,平均训练 863,856 行/任务,平均测试 233,295 行/任务
- 包含 CausalBench-XL、MuSIC-XL、PRING-XL、SciGym-XL 任务
- 公开大小:1.2 GB
Sequence-Genomics
- 6 个任务,平均训练 52,843 行/任务,平均测试 13,109 行/任务
- 包含 ASO-XL、CGBench-XL、DNALongBench-XL、ESCAPE-XL、Neurotox-XL、siRNA-XL 任务
- 公开大小:63 MB
Single-Cell-Perturbation
- 6 个任务,平均训练 57,755 行/任务,平均测试 14,608 行/任务
- 包含 CellVerse-XL、PerturBench-XL、scGeneScope-XL、Tahoe-XL、XAtlas-Orion-XL 任务
- 公开大小:1.2 GB
Structure
- 9 个任务,平均训练 69,157 行/任务,平均测试 13,137 行/任务
- 包含 CPSEA-XL、DAVIS-Complete-XL、DecoyDB-XL、DenoiseCryo-XL、ProteinConformers-XL、PSBench-XL 任务
- 公开大小:115 GB
任务详细信息
Chemical-Biology 任务详情
| 任务文件夹 | 任务标题 | 主要指标 |
|---|---|---|
| boom-xl-csd | BOOM-XL-CSD: 分布外分子属性预测 (CSD) | 按来源平均 Pearson r |
| chemcot-xl-molecule-counting | ChemCoT-XL: 分子亚结构计数 | 按来源平均 Pearson r |
| chemixhub-xl-conductivity | Chemixhub-XL-Conductivity: 混合物离子电导率预测 | 按来源平均 Pearson r |
| chemixhub-xl-viscosity | Chemixhub-XL-Viscosity: 混合物对数粘度预测 | 按来源平均 Pearson r |
| solubility-xl | Solubility-XL: 水溶性预测 | Pearson r |
| tdc-xl-cyp-inhibition | TDC-XL-CYP-Inhibition: CYP P450 药物代谢抑制 | 按来源平均 ROC-AUC |
| tdc-xl-dti-binding-affinity | TDC-XL-DTI-Binding-Affinity: 药物-靶点结合亲和力 | 按来源平均 Pearson r |
Imaging 任务详情
| 任务文件夹 | 任务标题 | 主要指标 |
|---|---|---|
| cellsam-xl-segmentation | CellSAM-XL: 细胞+细胞核二值分割 | 按来源平均 Dice |
| cryocrab-xl-quality | CryoCRAB-XL: 冷冻电镜显微图质量回归 | Pearson r |
| drugclass-xl-if | DrugClass-XL: 免疫荧光显微镜药物处理分类 | Macro-F1 |
| starc9-xl-crc-tissue | STARC-9-XL: 结直肠癌组织分类 | Macro-F1 |
| subcell-xl-localization | SubCell-XL: 亚细胞定位多标签分类 | 0.5 Macro-F1 + 0.5 mAP |
| survpath-xl-multimodal | SurvPath-XL-Multimodal: TCGA 从全切片图像+RNA+临床特征的生存分析 | 按癌症平均 C-index |
| survpath-xl-rna | SurvPath-XL-RNA: TCGA 从批量 RNA+临床特征的生存分析 | 按癌症平均 C-index |
Network-Biology 任务详情
| 任务文件夹 | 任务标题 | 主要指标 |
|---|---|---|
| causalbench-xl-grn | CausalBench-XL: 基因调控边缘分类 | 按来源平均 ROC-AUC |
| music-xl-seccomplex | MuSIC-XL-SECComplex: 从 SEC-MS 预测蛋白质共复合物 | ROC-AUC |
| pring-xl-cross-species-ppi | PRING-XL: 跨物种蛋白质-蛋白质相互作用预测 | 按来源平均 ROC-AUC |
| scigym-xl-sbml | SciGym-XL: SBML 模型补全 | 关于 delta_reactions 的 Pearson r |
Sequence-Genomics 任务详情
| 任务文件夹 | 任务标题 | 主要指标 |
|---|---|---|
| aso-xl-knockdown-efficacy | ASO-XL: 反义寡核苷酸敲低效率 | 按来源平均 Pearson r |
| cgbench-xl-variant | CGBench-XL: 临床变异致病性 | Macro-F1 |
| dnalongbench-xl-regulatory | DNALongBench-XL: 增强子-靶点-基因 + eQTL 分类 | 按来源平均 ROC-AUC |
| escape-xl-amp-multilabel | ESCAPE-XL: 多标签抗菌肽分类 | 0.5 Macro-F1 + 0.5 mAP |
| neurotox-xl-aso | Neurotox-XL: ASO 神经毒性 | 按来源平均 Pearson r |
| sirna-xl-knockdown-efficacy | siRNA-XL: RNA 干扰敲低效率 | 按来源平均 Pearson r |
Single-Cell-Perturbation 任务详情
| 任务文件夹 | 任务标题 | 主要指标 |
|---|---|---|
| cellverse-xl-cta | CellVerse-XL: 从排序基因列表进行单细胞注释与药物反应 | Macro-F1 |
| perturbench-xl-response | PerturBench-XL: 扰动-响应预测 | 按来源平均 delta-Pearson |
各任务训练/测试行数对比
Chemical-Biology 各任务行数
| 任务 | 训练行数 | 测试行数 |
|---|---|---|
| boom-xl-csd | 17,549 | 2,863 |
| chemcot-xl-molecule-counting | 2,487 | 622 |
| chemixhub-xl-conductivity | 37,199 | 9,300 |
| chemixhub-xl-viscosity | 253,022 | 63,256 |
| solubility-xl | 7,986 | 1,996 |
| tdc-xl-cyp-inhibition | 30,498 | 7,625 |
| tdc-xl-dti-binding-affinity | 148,531 | 37,132 |
Imaging 各任务行数
| 任务 | 训练行数 | 测试行数 |
|---|---|---|
| cellsam-xl-segmentation | 5,698 | 1,324 |
| cryocrab-xl-quality | 640 | 157 |
| drugclass-xl-if | 10,289 | 2,571 |
| starc9-xl-crc-tissue | 16,000 | 4,000 |
| subcell-xl-localization | 75,093 | 18,879 |
| survpath-xl-multimodal | 1,945 | 487 |
| survpath-xl-rna | 1,945 | 487 |
Network-Biology 各任务行数
| 任务 | 训练行数 | 测试行数 |
|---|---|---|
| causalbench-xl-grn | 3,290,506 | 822,318 |
| music-xl-seccomplex | 57,359 | 3,607 |
| pring-xl-cross-species-ppi | 107,280 | 107,184 |
| scigym-xl-sbml | 280 | 70 |
Sequence-Genomics 各任务行数
| 任务 | 训练行数 | 测试行数 |
|---|---|---|
| aso-xl-knockdown-efficacy | 20,522 | 4,095 |
| cgbench-xl-variant | 7,760 | 1,940 |
| dnalongbench-xl-regulatory | 24,425 | 7,349 |
| escape-xl-amp-multilabel | 65,870 | 16,489 |
| neurotox-xl-aso | 3,369 | 841 |
| sirna-xl-knockdown-efficacy | 195,111 | 47,940 |
Single-Cell-Perturbation 各任务行数
| 任务 | 训练行数 | 测试行数 |
|---|---|---|
| cellverse-xl-cta | 1,366 | 342 |
| perturbench-xl-response | 387 | 97 |
| scgenescope-xl-treatment | 214,783 | 53,694 |
| tahoe-xl-drug-response | 52,865 | 13,378 |
| tahoe-xl-single-cell | 74,880 | 19,577 |
| xatlas-orion-xl-perturb | 2,247 | 562 |
Structure 各任务行数
| 任务 | 训练行数 | 测试行数 |
|---|---|---|
| cpsea-xl-cyclic-peptide-affinity | 70,284 | 1,583 |
| cpsea-xl-cyclic-peptide-affinity-v2 | 70,284 | 1,583 |
| davis-complete-xl-dti | 20,332 | 5,304 |
| decoydb-xl-pose-classify | 68,076 | 17,578 |
| decoydb-xl-pose-rmsd | 68,076 | 17,578 |
| denoise-cryo-xl | 232 | 58 |
| proteinconformers-xl-mqa | 310,608 | 70,945 |
| proteinconformers-xl-mqa-v2 | 1,400 | 340 |
| psbench-xl-multimer-mqa | 13,121 | 3,260 |
领域映射说明
与原始 BioXArena 的领域映射关系:
sequence->sequence-genomicssingle-cell+perturbation-dynamics->single-cell-perturbation
获取方式
数据集在 Hugging Face 上分发,可通过以下方式获取:
- URL:
https://huggingface.co/datasets/mbzuai-ai4bio/BioXArena-Data-Public-XL - wget 下载:
wget "https://huggingface.co/datasets/mbzuai-ai4bio/BioXArena-Data-Public-XL/resolve/main/BioXArena-Data-Public-XL.tar.gz" - huggingface-cli 下载:
huggingface-cli download mbzuai-ai4bio/BioXArena-Data-Public-XL BioXArena-Data-Public-XL.tar.gz --repo-type dataset --local-dir .





