遇见数据集

WSI_Embedding_EBR

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

WSI_Embedding_EBR 是一个用于组织病理学全切片图像(WSI)特征提取的数据集,包含从原始 WSI_Embedding 数据集中分割出的 EBR 嵌入。数据集分为两个子集:coarse30 子集涵盖 30 个粗粒度类别,包含约 2319 张幻灯片;fine-other 子集涵盖 95 个细粒度诊断类别,包含 745 张幻灯片。总样本规模在 100K 到 1M 之间。数据集提供嵌入向量、标签文件以及运行信息和预处理档案,适用于图像特征提取、分类等下游任务。

WSI_Embedding_EBR is a dataset for feature extraction from whole slide images (WSI) in histopathology, containing EBR embeddings segmented from the original WSI_Embedding dataset. The dataset is divided into two subsets: the coarse30 subset covers 30 coarse-grained categories, including approximately 2,319 slides; the fine-other subset covers 95 fine-grained diagnostic categories, including 745 slides. The total sample size ranges from 100K to 1M. The dataset provides embedding vectors, label files, running information, and preprocessing archives, suitable for downstream tasks such as image feature extraction and classification.

创建时间:
2026-09-04
原始信息汇总

数据集概述

数据集名称:WSI_Embedding_EBR

数据集用途:该数据集是从 thanminh01/WSI_Embedding 数据集中拆分出的公共 EBR 嵌入(Embeddings)子集,主要用于特征提取任务,属于 Hub 提交健康检查而设计的数据集。

任务类型:特征提取(feature-extraction)

数据规模:样本数量在 100K 到 1M 之间。


数据集组成

数据集包含两个独立的队列(Cohort),需分开处理:

队列 Hub 路径 描述 切片数量(Slides) 类别数量(Classes)
粗粒度类别 embeddings/EBR-coarse30/ 30 类分类 约 2,319 30
细粒度其他类别 embeddings/EBR-fine-other/ 95 个诊断文件夹 745 95

标签文件(重要)

以下 CSV 标签文件是数据的关键组成部分,需要保留:

  • Run-Information/labels/EBR-coarse30-labels.csv
  • Run-Information/labels/EBR-fine-other-labels.csv
  • Run-Information/labels/EBR-fine-other-hub-labels.csv
  • 额外的便利副本存放在 labels/ 目录下

目录结构

embeddings/EBR-coarse30/<model>/<coords>/ embeddings/EBR-fine-other/<model>/<coords>/ Run-Information/runs-report/EBR-coarse30/run-info.zip Run-Information/runs-report/EBR-fine-other/run-info.zip Run-Information/prep/EBR-coarse30/<subdir>.zip Run-Information/prep/EBR-fine-other/<subdir>.zip Run-Information/labels/*.csv

使用说明:将每个压缩包(archive)解压到其对应的父目录中,即可恢复完整的目录树结构。

搜集汇总
数据集介绍
WSI_Embedding_EBR 数据集图片
构建方式
该数据集源自对大规模全切片病理图像(WSI)进行嵌入表示(Embedding)的公共资源,旨在促进组织病理学图像分析中的特征提取研究。构建方式上,数据集被划分为两个独立的队列:粗粒度30类别(coarse30)包含约2319张切片,涵盖30个诊断类别;细粒度其他类别(fine-other)包含745张切片,对应95个诊断文件夹。每个队列的嵌入向量按模型与坐标组织于层级目录中,并配套提供标签文件(CSV格式)以及运行信息与预处理档案(ZIP格式)。为保障Hub提交健康,数据从原始资源分离,用户需解压档案以恢复完整目录树。
使用方法
使用时,需保持两个队列相互独立,不应混淆。步骤包括:首先从HuggingFace仓库下载对应队列的嵌入文件,并解压ZIP档案至指定父目录以恢复结构。随后,参照`Run-Information/labels/`下的CSV标签文件,将嵌入向量与类别或诊断信息关联。用户可根据任务需求,选用全部或特定模型、坐标的嵌入,进行特征提取、分类模型训练或聚类分析。运行信息与预处理档案提供了实施细节,有助于参照原始流程。建议在论文或项目中注明数据集出处,并遵循数据使用许可协议。
背景与挑战
背景概述
WSI_Embedding_EBR数据集源于病理图像分析领域,由研究团队于近期构建,旨在为全切片图像(WSI)提供高质量的特征嵌入表示。该数据集源自thanminh01/WSI_Embedding,经过精心划分,形成两个互补的子集:EBR-coarse30包含约2319张切片,对应30个粗粒度类别;EBR-fine-other则包含745张切片,对应95个细粒度诊断类别。这一划分旨在支撑从粗粒度到细粒度的层级化病理图像分析任务,为特征提取、迁移学习及多实例学习等研究提供标准化基准。其发布对于推动计算病理学中大规模嵌入的复用与评估具有重要意义,促进了病理图像分析模型的泛化性与可复现性研究。
当前挑战
该数据集面临的挑战涵盖领域与构建两个层面。领域层面,WSI图像尺寸庞大、分辨率极高,且存在染色差异、组织变形及背景噪声,使得特征提取与分类任务极为复杂。EBR子集细粒度类别多达95种,类别间差异细微,对模型判别能力要求严苛。构建层面,原始数据需经过严格的预处理与嵌入生成流程,涉及坐标系统校准及大规模计算资源的调配,确保嵌入的稳定性和一致性。此外,将数据集拆分为多个档案并保持标签文件的完整性,需要精细的元数据管理和版本控制,以防止数据丢失或错位。同时,公开共享时需兼顾数据隐私与合规性,确保病理信息的匿名化处理,这些均对数据集的发布与维护构成挑战。
常用场景
经典使用场景
该数据集为数字病理学领域的表征学习研究提供了高质量的组织切片全切片图像(WSI)嵌入特征,其核心经典用途在于训练与评估基于弱监督学习的多实例学习(MIL)框架。研究者可借此对涵盖30类与95类不同诊断类别的整片切片进行特征级建模,广泛适用于癌症亚型分类、组织学分级及微卫星不稳定性预测等关键任务。利用预提取的嵌入向量,可极大缩短从原始像素到任务模型的开发周期,使之成为病理图像表示学习与域适应算法验证的理想基准。
解决学术问题
该数据集直面计算病理学中因全切片图像尺寸巨大、标注稀疏而长期存在的学习瓶颈问题。通过提供统一、标准化且经过质控的嵌入特征,它有效解决了跨中心、跨扫描仪数据分布漂移及模型复现性差的学术痛点。研究可借助该基准系统性地探讨模型容量、特征粒度与临床标签间的内在联系,推动从宏观形态到微观分子表型的可解释性关联研究,为构建更稳健、泛化的肿瘤自动诊断模型奠定了坚实的数据基础。
实际应用
在实际临床落地场景中,该数据集可作为辅助病理诊断系统的核心特征引擎,支撑基于数字切片的实时辅助分诊、疑难病例相似性检索,以及治疗相关生物标志物的涌现预测。其多粒度(粗粒度和细粒度)嵌入结构尤其适用于医院病理科进行大规模回顾性研究中的模型预筛与验证。此外,由于特征维度经过预降维处理,亦便于在资源受限的边缘医疗设备上部署合规的轻量级推理模块,推动精准医疗在基层机构的有机渗透。
数据集最近研究
最新研究方向
针对病理全切片图像(WSI)的特征嵌入表示,该数据集聚焦于多粒度诊断任务的嵌入层面优化,为计算病理学中的表征学习与模型泛化研究提供了新的公共基准。其细粒度划分(coarse30与fine-other)适应了从粗分类到细分类的层级化诊断需求,推动了针对罕见亚型的弱监督学习、域适应及大模型预训练等前沿方向的探索。数据集拆分策略亦有利于研究嵌入质量的评估与多中心数据整合中的批次效应校正,对提升AI辅助病理诊断的鲁棒性与可解释性具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务