遇见数据集

CellPath-Bench

收藏
arXiv2026-08-21 更新2026-08-25 收录
官方服务:

资源简介:

CellPath-Bench是一个多维基准,用于评估病理学基础模型在整张切片上的细胞表示能力。该基准包含25个经过质量控制的H&E-Xenium对齐组织切片,覆盖11个器官和7,079,283个细胞,并统一了细粒度和粗粒度的细胞分类体系。其创建过程首先从52个候选Xenium数据集中筛选出高质量切片,通过参考引导的分子注释和独立形态学评估构建而成。该基准旨在系统诊断模型在细胞类型解码能力及其跨组织、数据集和器官的泛化性能,为病理学基础模型的改进提供标准化测评框架。

CellPath-Bench is a multidimensional benchmark for evaluating the cell representation capabilities of foundational pathology models on whole-slide tissue sections. This benchmark includes 25 quality-controlled H&E-Xenium co-registered tissue sections spanning 11 organs and encompassing 7,079,283 cells in total, and unifies both fine-grained and coarse-grained cell classification taxonomies. It was developed by first screening high-quality sections from 52 candidate Xenium datasets, and constructed via reference-guided molecular annotation and independent morphological assessment. This benchmark aims to systematically evaluate the cell type decoding capabilities of models and their generalization performance across tissues, datasets and organs, providing a standardized evaluation framework for the improvement of foundational pathology models.

创建时间:
2026-08-21
原始信息汇总

CellPath-Bench 数据集详情总结

数据集概述

CellPath-Bench 是一个面向病理学基础模型的细胞级线性探针基准测试平台,用于评估病理学基础模型在细胞级分类任务中的表示质量。该基准的核心特点是:模型权重在评估过程中不被更新,因此所有指标反映的是模型的特征表示质量,而非微调后的准确率。

评估设置

  • 目标任务:细胞级分类(cell-level classification)
  • 评估方式:线性探针(Linear Probe),冻结模型权重
  • 评估协议:IS(in-section)、IOCD(intra-organ LOSO)、MOCV(organ-stratified CV)、LOOO(leave-one-organ-out)等多种协议
  • 分类学层次:支持HE-L3 fine(主)和HE-L1 coarse 两种层次粒度
  • 放大倍数:涵盖10x、20x、40x三种倍率
  • 读出头类型:Nucleus (bilinear)、Patch CLS、Patch mean-pool、Concat(Nucleus, CLS)等多种配置
  • 统计方法:所有指标均为器官或折平衡均值,并采用百分位自助法(B=2000)计算95%置信区间

核心结论

  • 最佳模型:UNI2-h,Macro F1 = 0.369(95% CI: 0.321–0.417)
  • 最佳与最差差距:0.069(Macro F1)
  • 与第一名不可区分的模型:19个(其95%置信区间覆盖了榜首模型的均值)
  • 参与比较的模型总数:30个

模型排行榜(前10名)

排名 模型 架构 特征维度 Macro F1 95% CI
1 UNI2-h ViT-g/14 1536 0.3694 0.321 – 0.417
2 SEAL-UNI2 ViT-g/14 + LoRA 1536 0.3693 0.321 – 0.416
3 H-optimus-1 ViT-g/14 1536 0.3674 0.321 – 0.412
4 Virchow2 ViT-H/14 1280 0.3627 0.318 – 0.406
5 H-optimus-0 ViT-g/14 1536 0.3612 0.316 – 0.405
6 H0-mini ViT-B/14 768 0.3596 0.315 – 0.403
7 GPFM ViT-L/14 1024 0.3555 0.311 – 0.399
8 Virchow ViT-H/14 1280 0.3551 0.310 – 0.399
9 Hibou-L ViT-L/14 1024 0.3540 0.311 – 0.396
10 UNI ViT-L/16 1024 0.3506 0.306 – 0.394

注:所有模型在25/25个切片上均完成了评估。

数据集结构说明

该页面包含多个功能面板:

  • Leaderboard:模型性能排名与置信区间可视化
  • Readouts:不同读出头配置的评估结果
  • Transfer:迁移学习相关数据
  • Data panel:数据集详情
  • Cell types:细胞类型信息
  • Section atlas:切片图谱
  • Methods:方法学说明

页面还提供图表、表格及CSV格式的数据导出功能,便于用户深入分析。

搜集汇总
数据集介绍
CellPath-Bench 数据集图片
构建方式
CellPath-Bench的构建始于对52个候选Xenium数据集的系统性质量控制,最终筛选出25个空间配准的H&E-Xenium组织切片,覆盖11个器官与7,079,283个细胞。通过参考引导的分子注释,利用14个scRNA-seq参考数据集及基于300余篇文献的标记知识库,将细胞类型统一为68种分子细胞类型,并进一步映射为9类细粒度与3类粗粒度分类体系。随后,采用CellViT++独立预测核形态,以互近邻匹配与形态学-注释一致性评分评估组织学一致性,最终按评分排序形成主要评估面板S25。
特点
CellPath-Bench的核心特征在于其多维评估能力,不仅衡量细胞类型信息的线性可解码性(Nuc Macro-F1),还通过Cell Representation Advantage(CRA)和Cell Representation Transferability(CRT)分别刻画核锚定表征的局部优势与跨域泛化能力。其基准框架固定了细胞参考、空间读取方式与分类器容量,使不同架构的模型可在统一条件下公平比较。大规模评估涵盖30个病理专用及通用基础模型,涉及超过30万次线性探针运行,揭示了模型间在细胞类型解码与跨域迁移上的显著差异。
使用方法
使用CellPath-Bench时,研究者将预训练的基础模型编码器保持冻结,输入配准的H&E全切片图像,在相应核坐标处提取空间特征。评估涵盖三种放大倍数(40×、20×、10×)、两种分类粒度及七种表征模式,其中Nuc作为主要细胞级读取方式,Mean作为补丁级参考。通过四种评估协议(IS、IOCD、MOCV、LOOO),分别测试空间内转移、数据集间迁移、多器官交叉验证及留一器官外推,并以Macro-F1为主要指标,辅以配对Wilcoxon符号秩检验进行统计比较,从而全面诊断基础模型的细胞表征能力。
背景与挑战
背景概述
CellPath-Bench,一个多维度评估病理学基础模型(PFM)细胞级表示能力的基准,由中国科学院大学、中国科学院自动化研究所及阿里巴巴达摩院等机构的研究人员联合创建。该基准发布于2026年,旨在针对现有基准无法系统评估PFM在单细胞分辨率下对细胞类型信息编码能力的问题。通过构建包含11种器官、25个组织切片、超过700万个细胞的高质量H&E-Xenium配对数据集,CellPath-Bench引入CRA和CRT两项指标,从绝对解码能力和跨域泛化能力两个维度刻画模型特性。该基准对30种病理学专用及通用基础模型进行了304,920次受控线性探针评估,揭示了不同PFM在细胞级表征上的显著差异,为病理学基础模型的开发与应用提供了重要的诊断工具。
当前挑战
CellPath-Bench面临的挑战首先在于细胞级表征评估的领域问题:现有基准多聚焦于组织或全切片级任务,难以准确反映PFM对单个细胞类型信息的编码能力,而该能力对于理解肿瘤微环境和精准病理诊断至关重要。构建过程中,挑战尤为严峻:需要从52个候选Xenium数据集中,经严格质控筛选出25个高质量切片,并确保H&E图像与转录组数据的空间配准精确无误;此外,细胞类型注释需整合多个单细胞RNA测序参考集,并统一不同来源间的标签体系,协调68种分子细胞类型与H&E形态学分类的一致性,最终依赖病理学家的手工校验与计算方法的结合,这一过程涉及跨数据集的标注偏差和组织异质性难题。
常用场景
经典使用场景
CellPath-Bench作为病理学基础模型(PFMs)在细胞层面的多维评估基准,其经典使用场景聚焦于系统性地诊断模型对全切片图像中细胞类型信息的编码与解码能力。研究者利用该基准在统一的H&E-Xenium对齐组织切片面板上,通过核坐标锚定的线性探针评估冻结核特征,以量化不同模型在细胞类型分类、空间读取敏感性以及跨组织、跨数据集和跨器官转移能力方面的表现。该基准提供了标准化的评估协议,使得不同架构、规模和预训练范式的模型能够在同一细胞参考下进行公平比较,从而描绘出模型间的多维能力轮廓。
实际应用
在实际应用中,CellPath-Bench为病理学基础模型的选择和部署提供了关键指导,尤其在需要细胞级别解析的临床和研究场景中,例如肿瘤微环境分析、细胞类型注释和空间生物学研究。基准的评估结果帮助研究者和临床医生识别出在细胞表征方面表现优异的模型,从而在计算病理学工作流中优化特征提取环节,提高下游任务如疾病诊断、预后预测和生物标志物发现的准确性。此外,该基准的平台特性使其成为模型开发者的标准测试环境,促进了模型迭代和验证过程中的质量保障。
衍生相关工作
CellPath-Bench的发布推动了病理学基础模型评估方法的系列衍生工作。其多器官、多协议的评估框架启发了一系列针对不同表征粒度(如token级、区域级和空间域)的基准构建,如PFM-DenseBench、PathoCellBench和SpaPath-Bench等。这些工作共同构建了从细胞到组织微环境的层次化评估体系,促进了病理学基础模型在复杂生物学问题上的多维诊断与改进。此外,CellPath-Bench提供的标准化细胞参考和评估协议也被用于预训练模型的消融研究和迁移学习策略的优化,衍生出关于模型规模、预训练数据域和视觉语言对齐影响的新见解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务