遇见数据集

BioXArena-Data-Public-XL

收藏
Hugging Face2026-07-07 更新2026-07-08 收录
官方服务:

资源简介:

BioXArena-Data-Public-XL是BioXArena-XL的公共数据包,包含用于生物信息学AI代理开发和推理的公开数据。该数据集是原始BioXArena的更大规模变体,专注于更少但更重、更现实的任务。数据涵盖6个核心生物信息学领域:化学生物学、成像、网络生物学、序列基因组学、单细胞扰动和结构生物学,共包含39个具体任务。每个任务遵循统一的目录结构,包含任务描述文件、样本提交模板、训练/测试数据表以及模态特定的公开资产。数据集规模显著扩大,体现在:更大的队列和样本量、更广泛的来源覆盖(多个上游数据集、物种、细胞系等)、更难的泛化划分(保留药物、扰动、靶点等)、文件清单提交方式以及按来源/靶点/组织等分组的主要评估指标。具体数据规模方面,化学生物学领域平均每任务训练71,039行;成像领域15,944行;网络生物学领域863,856行;序列基因组学领域52,843行;单细胞扰动领域57,755行;结构领域69,157行。整个公共数据包大小约147GB。数据集适用于分子属性预测、图像分割与分类、基因调控网络推断、基因组学任务、单细胞分析和蛋白质结构预测等多种生物信息学AI任务。

BioXArena-Data-Public-XL is the public data package of BioXArena-XL, containing publicly available data for bioinformatics AI agent development and inference. This dataset is a larger-scale variant of the original BioXArena, focusing on fewer but heavier and more realistic tasks. The data covers 6 core bioinformatics domains: chemical biology, imaging, network biology, sequence genomics, single-cell perturbation, and structural biology, comprising a total of 39 specific tasks. Each task follows a unified directory structure, including task description files, sample submission templates, training/test data tables, and modality-specific public assets. The dataset scale is significantly expanded, reflected in: larger cohorts and sample sizes, broader source coverage (multiple upstream datasets, species, cell lines, etc.), harder generalization splits (retaining drugs, perturbations, targets, etc.), file list submission methods, and main evaluation metrics grouped by source/target/tissue, etc. In terms of specific data scale, the chemical biology domain averages 71,039 rows per task; imaging domain 15,944 rows; network biology domain 863,856 rows; sequence genomics domain 52,843 rows; single-cell perturbation domain 57,755 rows; and structural domain 69,157 rows. The entire public data package size is approximately 147GB. The dataset is suitable for various bioinformatics AI tasks such as molecular property prediction, image segmentation and classification, gene regulatory network inference, genomics tasks, single-cell analysis, and protein structure prediction.

创建时间:
2026-06-25
原始信息汇总

BioXArena-Data-Public-XL 数据集概述

基本信息

该数据集是 BioXArena-XL 的公开数据包,包含智能体在开发和推理过程中使用的公开输入、任务描述和样本提交模板。私有标签存储在匹配的 BioXArena-Data-Private-XL 包中。

数据规模

  • 领域数量:6 个
  • 任务总数:39 个
  • 公开数据包大小:147 GB
  • 对比原始 BioXArena:原始包 105 GB,9 个领域,76 个任务

各领域任务数量

领域 任务数
chemical-biology 7
imaging 7
network-biology 4
sequence-genomics 6
single-cell-perturbation 6
structure 9

数据目录结构

每个任务遵循以下顶层布局:

BioXArena-Data-Public-XL/ -- <domain>/ -- <task>/ -- public/ |-- description.md |-- sample_submission.csv |-- train.csv |-- test.csv -- modality-specific public assets

各任务核心文件

  • public/description.md:任务描述
  • public/sample_submission.csv:样本提交模板
  • public/train.csv:训练集
  • public/test.csv:测试集
  • 特定模态的公开资产:因任务而异(如显微镜图像、分割输入、扰动-响应特征、冷冻电镜体积、分子/结构特征、序列元数据、临床协变量、多模态组学特征)

XL 版本的核心差异

BioXArena-XL 是一个精心策划的更大规模变体,具有以下特点:

  • 更大的队列/样本/测试项:每任务更多样本
  • 更广泛的来源覆盖:如多个上游数据集、物种、细胞系、靶点、检测家族、组织或癌症队列
  • 更难泛化分割:如保留药物、扰动、靶点、复合物、来源或OOD化学
  • 文件清单提交submission.csv 引用生成的数组、掩码或体积,而非将所有预测存储为标量 CSV 字段
  • 分组主指标:按来源、靶点、复合物、组织、癌症队列、细胞系或PDB条目评估性能

各领域 XL 规模信号

Chemical-Biology

  • 7 个任务,平均训练 71,039 行/任务,平均测试 17,542 行/任务
  • 包含 BOOM-XL-CSD、ChemCoT-XL、Chemixhub-XL、Solubility-XL、TDC-XL 系列任务
  • 公开大小:195 MB

Imaging

  • 7 个任务,平均训练 15,944 行/任务,平均测试 3,986 行/任务
  • 包含 CellSAM-XL、CryoCRAB-XL、DrugClass-XL、STARC-9-XL、SubCell-XL、SurvPath-XL 系列任务
  • 公开大小:30 GB

Network-Biology

  • 4 个任务,平均训练 863,856 行/任务,平均测试 233,295 行/任务
  • 包含 CausalBench-XL、MuSIC-XL、PRING-XL、SciGym-XL 任务
  • 公开大小:1.2 GB

Sequence-Genomics

  • 6 个任务,平均训练 52,843 行/任务,平均测试 13,109 行/任务
  • 包含 ASO-XL、CGBench-XL、DNALongBench-XL、ESCAPE-XL、Neurotox-XL、siRNA-XL 任务
  • 公开大小:63 MB

Single-Cell-Perturbation

  • 6 个任务,平均训练 57,755 行/任务,平均测试 14,608 行/任务
  • 包含 CellVerse-XL、PerturBench-XL、scGeneScope-XL、Tahoe-XL、XAtlas-Orion-XL 任务
  • 公开大小:1.2 GB

Structure

  • 9 个任务,平均训练 69,157 行/任务,平均测试 13,137 行/任务
  • 包含 CPSEA-XL、DAVIS-Complete-XL、DecoyDB-XL、DenoiseCryo-XL、ProteinConformers-XL、PSBench-XL 任务
  • 公开大小:115 GB

任务详细信息

Chemical-Biology 任务详情

任务文件夹 任务标题 主要指标
boom-xl-csd BOOM-XL-CSD: 分布外分子属性预测 (CSD) 按来源平均 Pearson r
chemcot-xl-molecule-counting ChemCoT-XL: 分子亚结构计数 按来源平均 Pearson r
chemixhub-xl-conductivity Chemixhub-XL-Conductivity: 混合物离子电导率预测 按来源平均 Pearson r
chemixhub-xl-viscosity Chemixhub-XL-Viscosity: 混合物对数粘度预测 按来源平均 Pearson r
solubility-xl Solubility-XL: 水溶性预测 Pearson r
tdc-xl-cyp-inhibition TDC-XL-CYP-Inhibition: CYP P450 药物代谢抑制 按来源平均 ROC-AUC
tdc-xl-dti-binding-affinity TDC-XL-DTI-Binding-Affinity: 药物-靶点结合亲和力 按来源平均 Pearson r

Imaging 任务详情

任务文件夹 任务标题 主要指标
cellsam-xl-segmentation CellSAM-XL: 细胞+细胞核二值分割 按来源平均 Dice
cryocrab-xl-quality CryoCRAB-XL: 冷冻电镜显微图质量回归 Pearson r
drugclass-xl-if DrugClass-XL: 免疫荧光显微镜药物处理分类 Macro-F1
starc9-xl-crc-tissue STARC-9-XL: 结直肠癌组织分类 Macro-F1
subcell-xl-localization SubCell-XL: 亚细胞定位多标签分类 0.5 Macro-F1 + 0.5 mAP
survpath-xl-multimodal SurvPath-XL-Multimodal: TCGA 从全切片图像+RNA+临床特征的生存分析 按癌症平均 C-index
survpath-xl-rna SurvPath-XL-RNA: TCGA 从批量 RNA+临床特征的生存分析 按癌症平均 C-index

Network-Biology 任务详情

任务文件夹 任务标题 主要指标
causalbench-xl-grn CausalBench-XL: 基因调控边缘分类 按来源平均 ROC-AUC
music-xl-seccomplex MuSIC-XL-SECComplex: 从 SEC-MS 预测蛋白质共复合物 ROC-AUC
pring-xl-cross-species-ppi PRING-XL: 跨物种蛋白质-蛋白质相互作用预测 按来源平均 ROC-AUC
scigym-xl-sbml SciGym-XL: SBML 模型补全 关于 delta_reactions 的 Pearson r

Sequence-Genomics 任务详情

任务文件夹 任务标题 主要指标
aso-xl-knockdown-efficacy ASO-XL: 反义寡核苷酸敲低效率 按来源平均 Pearson r
cgbench-xl-variant CGBench-XL: 临床变异致病性 Macro-F1
dnalongbench-xl-regulatory DNALongBench-XL: 增强子-靶点-基因 + eQTL 分类 按来源平均 ROC-AUC
escape-xl-amp-multilabel ESCAPE-XL: 多标签抗菌肽分类 0.5 Macro-F1 + 0.5 mAP
neurotox-xl-aso Neurotox-XL: ASO 神经毒性 按来源平均 Pearson r
sirna-xl-knockdown-efficacy siRNA-XL: RNA 干扰敲低效率 按来源平均 Pearson r

Single-Cell-Perturbation 任务详情

任务文件夹 任务标题 主要指标
cellverse-xl-cta CellVerse-XL: 从排序基因列表进行单细胞注释与药物反应 Macro-F1
perturbench-xl-response PerturBench-XL: 扰动-响应预测 按来源平均 delta-Pearson

各任务训练/测试行数对比

Chemical-Biology 各任务行数

任务 训练行数 测试行数
boom-xl-csd 17,549 2,863
chemcot-xl-molecule-counting 2,487 622
chemixhub-xl-conductivity 37,199 9,300
chemixhub-xl-viscosity 253,022 63,256
solubility-xl 7,986 1,996
tdc-xl-cyp-inhibition 30,498 7,625
tdc-xl-dti-binding-affinity 148,531 37,132

Imaging 各任务行数

任务 训练行数 测试行数
cellsam-xl-segmentation 5,698 1,324
cryocrab-xl-quality 640 157
drugclass-xl-if 10,289 2,571
starc9-xl-crc-tissue 16,000 4,000
subcell-xl-localization 75,093 18,879
survpath-xl-multimodal 1,945 487
survpath-xl-rna 1,945 487

Network-Biology 各任务行数

任务 训练行数 测试行数
causalbench-xl-grn 3,290,506 822,318
music-xl-seccomplex 57,359 3,607
pring-xl-cross-species-ppi 107,280 107,184
scigym-xl-sbml 280 70

Sequence-Genomics 各任务行数

任务 训练行数 测试行数
aso-xl-knockdown-efficacy 20,522 4,095
cgbench-xl-variant 7,760 1,940
dnalongbench-xl-regulatory 24,425 7,349
escape-xl-amp-multilabel 65,870 16,489
neurotox-xl-aso 3,369 841
sirna-xl-knockdown-efficacy 195,111 47,940

Single-Cell-Perturbation 各任务行数

任务 训练行数 测试行数
cellverse-xl-cta 1,366 342
perturbench-xl-response 387 97
scgenescope-xl-treatment 214,783 53,694
tahoe-xl-drug-response 52,865 13,378
tahoe-xl-single-cell 74,880 19,577
xatlas-orion-xl-perturb 2,247 562

Structure 各任务行数

任务 训练行数 测试行数
cpsea-xl-cyclic-peptide-affinity 70,284 1,583
cpsea-xl-cyclic-peptide-affinity-v2 70,284 1,583
davis-complete-xl-dti 20,332 5,304
decoydb-xl-pose-classify 68,076 17,578
decoydb-xl-pose-rmsd 68,076 17,578
denoise-cryo-xl 232 58
proteinconformers-xl-mqa 310,608 70,945
proteinconformers-xl-mqa-v2 1,400 340
psbench-xl-multimer-mqa 13,121 3,260

领域映射说明

与原始 BioXArena 的领域映射关系:

  • sequence -> sequence-genomics
  • single-cell + perturbation-dynamics -> single-cell-perturbation

获取方式

数据集在 Hugging Face 上分发,可通过以下方式获取:

  • URLhttps://huggingface.co/datasets/mbzuai-ai4bio/BioXArena-Data-Public-XL
  • wget 下载wget "https://huggingface.co/datasets/mbzuai-ai4bio/BioXArena-Data-Public-XL/resolve/main/BioXArena-Data-Public-XL.tar.gz"
  • huggingface-cli 下载huggingface-cli download mbzuai-ai4bio/BioXArena-Data-Public-XL BioXArena-Data-Public-XL.tar.gz --repo-type dataset --local-dir .
搜集汇总
数据集介绍
BioXArena-Data-Public-XL 数据集图片
构建方式
BioXArena-Data-Public-XL数据集基于原BioXArena框架进行扩展与精炼,涵盖化学-生物学、影像、网络生物学、序列基因组学、单细胞扰动及结构生物学六大领域,共包含39个任务。每个任务按照统一目录结构组织,提供公开输入、任务描述文档及样本提交模板。构建时针对部分任务进行了重映射与合并,例如将序列域与单细胞扰动域整合为更聚焦的任务集,并大幅扩充样本规模,使得平均每个任务的训练样本数显著增加。数据以压缩包形式在HuggingFace平台发布,用户可通过wget或huggingface-cli工具便捷获取。
使用方法
用户可通过HuggingFace平台直接下载BioXArena-Data-Public-XL.tar.gz压缩包,解压后获得按领域与任务组织的目录结构。每个任务的public文件夹内包含description.md(任务描述)、sample_submission.csv(提交模板)、train.csv与test.csv(训练与测试数据),以及特定模态的公开资源。使用时可首先阅读description.md了解任务目标与评价指标,然后利用train.csv进行模型训练,并通过sample_submission.csv格式生成预测结果。对于需要提交图像、掩膜或体积等非标量输出的任务,需按照文件清单提交要求准备对应文件。
背景与挑战
背景概述
BioXArena-Data-Public-XL 是由阿联酋穆罕默德·本·扎耶德人工智能大学(MBZUAI)AI4Bio研究团队于近期构建的大规模生物医学多模态基准数据集。该数据集作为BioXArena的增强扩展版本,旨在解决传统生物信息学基准在数据规模、模态覆盖和任务真实性方面的不足。核心研究问题聚焦于如何通过整合化学、影像、组学、结构等多层次生物数据,为人工智能模型提供更具挑战性的泛化能力评估平台。BioXArena-XL涵盖6个领域、39项任务,平均每项任务的训练样本数较原始版本显著提升,尤其在网络生物学领域实现数量级增长(如因果基因调控网络任务从数千条边扩展至数百万条)。其独特的文件清单提交机制和分组评估指标,为生物计算领域提供了更贴近真实科研场景的标准化测试环境,对推动多模态生物人工智能发展具有重要影响。
当前挑战
该数据集所面临的挑战具有双重性:首先,在领域问题层面,生物数据固有的高维度、小样本、异质性及跨模态关联难题,使得模型在不同任务间(如从化学属性预测到细胞成像分析)的泛化能力受限。特别是在网络生物学任务中,基因调控网络的因果推断面临稀疏性和噪声干扰,而结构任务中冷冻电镜体积预测则需处理大规模3D数据。其次,在构建过程中,团队需协调来自公共数据库、实验平台和文献的异构数据源,处理数据格式不统一(如CSV与NPZ文件混杂)和标签缺失问题;同时,为设计更贴近真实分布的训练/测试划分(如留出特定药物或细胞系),需在保持任务生态完整性的前提下实现严格的分布外泛化评估。文件清单提交机制也要求标准化生成阵列、掩膜等多模态输出格式。
常用场景
经典使用场景
BioXArena-Data-Public-XL作为生物医学人工智能领域的综合性评测基准,其最经典的使用场景在于系统性地评估和比较不同AI模型在跨模态生物数据分析中的表现。该数据集涵盖了化学-生物学、成像、网络生物学、序列基因组学、单细胞扰动以及结构生物学六大领域,共39项精心设计的任务。研究者可利用其标准化的训练集和测试集,在药物靶标结合亲和力预测、细胞分割、基因调控网络推断、临床变异解读、单细胞扰动响应预测以及蛋白质结构质量评估等子任务上,对模型的泛化能力、鲁棒性和域迁移性能进行深入分析。数据集提供的'public/description.md'文件明确了每项任务的背景、目标与评价指标(如Pearson相关系数、ROC-AUC、Dice系数等),确保了评测流程的可重复性与横向可比性,使之成为衡量生物信息学算法进展的权威参考。
解决学术问题
该数据集系统性地解决了生物医学研究中因数据规模不足、域分布单一和评估标准不统一而导致的模型泛化能力欠佳这一核心学术难题。通过提供更大规模的样本量(例如网络生物学域平均每任务训练样本达86万条)、更广泛的来源覆盖(涵盖多物种、多细胞系、多组织类型)以及更严苛的泛化性分割(如保留未知药物、未知复合物或域外化学结构),BioXArena-XL迫使模型从简单模式拟合转向对生物潜变量与跨域不变表征的学习。它推动了因果推断(如CausalBench-XL的基因调控边分类)、多模态融合(如SurvPath-XL结合全切片图像、RNA和临床特征预测生存期)以及域自适应(如跨物种蛋白质互作预测)等前沿方向的发展,其科学意义在于为计算生物学提供了具有生物学现实意义的压力测试平台,引导学界关注模型的实用性与可解释性,而非单一指标的最大化。
实际应用
在生物医药研发的实际场景中,BioXArena-XL直接支撑着多个关键应用方向。药物发现领域,化学-生物学任务可用于高通量筛选候选分子的物理化学性质(如溶解度、黏度)、安全性(如CYP酶抑制)及靶标亲和力,辅助药物化学家快速收敛活性化合物空间。精准医学方面,临床变异分类(CGBench-XL)和生存分析(SurvPath-XL)任务能为基因组解读报告和预后风险分层提供AI辅助支持。合成生物学中,siRNA和ASO敲低功效预测任务可直接指导核酸药物的序列设计,降低实验试错成本。此外,细胞分割与亚细胞定位分类任务为高内涵成像分析流程提供了自动化核心组件,在神经科学、肿瘤学和发育生物学的基础研究中具有广泛用途。因此,该数据集架起了算法研发与转化医学之间的桥梁,使模型从学术竞赛走向实际验证。
数据集最近研究
最新研究方向
BioXArena-Data-Public-XL数据集代表了生物医学AI基准测试的前沿演进方向,其核心创新在于构建了大规模、多模态的真实世界生物数据评测体系。该数据集横跨化学生物学、成像、网络生物学、序列基因组学、单细胞扰动及结构生物学六大领域,囊括39项复杂任务,显著提升了每项任务的样本规模和评价难度。尤其在网络生物学领域,causalbench-xl-grn任务通过大规模因果基因调控网络预测,推动了因果推断在基因组学中的深化应用;在成像方面,cryocrab-xl-quality与survpath-xl-multimodal等任务将冷冻电镜微图质量回归与多模态生存分析纳入基准,呼应了精准医学与组学整合的热点趋势。此外,数据集采用硬性泛化分割和分源分组评价策略,强化了对模型泛化能力的严格检验,为生物AI从模型性能竞赛迈向临床级可靠性评估奠定了关键基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务