遇见数据集

CellImageNet

收藏
Hugging Face2026-07-10 更新2026-07-11 收录
官方服务:

资源简介:

CellImageNet是一个大规模单细胞图像数据库,包含配对的DAPI核图像与细胞类型注释,数据来源于公开的10x Genomics Xenium数据集。该数据集包含来自42个Xenium样本(28个人类组织和14个小鼠组织)的约1000万个细胞,涵盖了不同的物种、生物学条件和组织类型。每个细胞都标注了31个统一的细胞类型类别(由原始数据集的注释整合而来)。对于每个细胞,数据集提供了两个互补尺度的DAPI图像裁剪,均以细胞核质心为中心:一个是2.5倍尺度的紧密视图,用于捕捉精细的核形态;另一个是10倍尺度的更宽视图,用于捕捉局部组织环境/邻域信息。这些裁剪图像以其原始分辨率提供(不同样本的像素大小可变)。数据集在Hugging Face Hub上以两个配置提供:`human`(28个人类样本,约650万个细胞)和`mouse`(14个小鼠样本,约340万个细胞),每个配置仅暴露一个`full`分割,没有官方的训练/测试划分。每个数据样本包含三个部分:`2p5x.png`(2.5倍DAPI裁剪,灰度图像)、`10x.png`(10倍DAPI裁剪,灰度图像)和`json`(元数据字典)。元数据字段包括:`cell_id`、`dataset`(来源Xenium样本)、`species`(Human/Mouse)、`tissue`、`condition`、`cell_type`(31个类别之一,部分小鼠样本中有一个小的`Unknown`类别)以及`x_centroid`和`y_centroid`(核质心坐标,单位为微米)。该数据集适用于图像分类任务,特别是基于细胞核形态的细胞类型分类,也是视觉基础模型MorphPT的训练语料。

CellImageNet is a large-scale single-cell image database containing paired DAPI nuclear images and cell type annotations, derived from the publicly available 10x Genomics Xenium dataset. This dataset encompasses approximately 10 million cells from 42 Xenium samples (28 human tissues and 14 mouse tissues), covering diverse species, biological conditions and tissue types. Each cell is annotated with one of 31 unified cell type categories integrated from the annotations of the original dataset. For each cell, the dataset provides two DAPI image crops at complementary scales, both centered at the nuclear centroid: a 2.5× tight view for capturing fine nuclear morphology, and a 10× broader view for capturing local tissue environment/neighborhood information. These cropped images are provided at their original resolution, with pixel sizes varying across different samples. The dataset is hosted on the Hugging Face Hub with two configurations: `human` (28 human samples, ~6.5 million cells) and `mouse` (14 mouse samples, ~3.4 million cells), each configuration exposes only a `full` split with no official train/test partition. Each data sample consists of three components: `2p5x.png` (2.5× DAPI crop, grayscale image), `10x.png` (10× DAPI crop, grayscale image) and `json` (metadata dictionary). The metadata fields include: `cell_id`, `dataset` (source Xenium sample), `species` (Human/Mouse), `tissue`, `condition`, `cell_type` (one of the 31 categories, with a small `Unknown` category present in some mouse samples), as well as `x_centroid` and `y_centroid` (nuclear centroid coordinates in micrometers). This dataset is suitable for image classification tasks, particularly cell type classification based on nuclear morphology, and also serves as the training corpus for the visual foundation model MorphPT.

创建时间:
2026-07-01
原始信息汇总

数据集概述

  • 数据集名称:CellImageNet
  • 许可协议:CC BY 4.0
  • 任务类别:图像分类
  • 标签:生物学、单细胞、细胞类型分类、DAPI、核形态学、空间转录组学、Xenium
  • 数据规模:1M < n < 10M(约1000万细胞)

数据内容

CellImageNet是一个大规模单细胞图像数据库,包含来自42个Xenium样本(28个人类、14个小鼠)的DAPI核图像与细胞类型注释对。每个细胞提供两种尺度的DAPI裁剪图像:

  • 2.5×:捕捉精细核形态的紧凑视图。
  • 10×:捕捉局部组织背景的宽视野视图。

图像以原始分辨率存储,未进行预缩放,用户需自行调整至固定输入尺寸(如224×224)。

数据配置与划分

配置 内容
human 28个人类Xenium样本(约650万细胞)
mouse 14个小鼠Xenium样本(约340万细胞)

数据集未提供官方训练/测试划分,每个配置仅包含一个full划分。用于训练MorphPT的具体子集在MorphPT模型仓库splits/目录中指定。

数据模式(WebDataset格式)

每个样本(一个细胞)包含三个成员:

成员 类型 描述
2p5x.png 图像 2.5× DAPI裁剪(灰度,原始分辨率)
10x.png 图像 10× DAPI裁剪(灰度,原始分辨率)
json 字典 元数据

json字段包括:cell_id(细胞ID)、dataset(源Xenium样本)、species(物种,人类/小鼠)、tissue(组织)、condition(条件)、cell_type(细胞类型,属于31个类别之一,部分小鼠样本包含Unknown)、x_centroidy_centroid(核质心,单位为微米)。

细胞类型类别

31个统一的细胞类型标签: Astrocytes · B cells · Brain cancer cells · Cardiac muscle cells · Chondrocytes · Colon cancer cells · Endothelial cells · Ependymal cells · Epithelial cells · Erythrocytes · Fibroblasts · Kidney cancer cells · Liver cancer cells · Lung cancer cells · Mesangial cells · Microglia · Myeloid cells · NK cells · Neurons · OPCs · Oligodendrocytes · Ovary cancer cells · Pancreas cancer cells · Pericytes · Schwann cells · Skeletal muscle cells · Skin cancer cells · Smooth muscle cells · Stem and progenitor cells · Stromal cells · T cells

Unknown仅出现在小鼠数据中(约13.4万细胞,占小鼠划分类别的3.8%),表示源数据中未注释的细胞。若需要干净的31类标签空间,可过滤掉这些细胞。

数据构建

数据来源于10x Genomics Xenium平台的42个公开样本(28个人类、14个小鼠)。从每个组织的DAPI图像中提取最大强度投影通道,利用Xenium onboard analysis提供的核分割掩码,在0.2125 µm/px分辨率下转换为像素。筛选条件:核区域≥5像素,边界框边长≥10像素。对于每个细胞,以核质心为中心提取两种尺度的方形裁剪图像,并在图像边界进行零填充。

发布状态

v1.0.0(完整版):所有42个样本(28个人类、14个小鼠)均已发布。完整样本列表包括人类肺、结肠、心脏、肾脏、肝脏、皮肤、扁桃体、胰腺、淋巴结、卵巢、脑等组织,以及小鼠脑、结肠、幼鼠等样本。

许可与引用

CellImageNet是10x Genomics Xenium公开数据集的衍生作品,图像裁剪部分根据CC BY 4.0许可发布;细胞类型注释和衍生元数据同样采用CC BY 4.0许可。使用时需注明10x Genomics和CellImageNet作者,链接许可,并指明更改内容(裁剪/重新注释)。所有42个源样本的完整列表(数据集名称、物种、组织、条件及10x数据集URL)在attribution_manifest.csv中提供。

局限

  • 仅包含DAPI核形态图像,无基因表达或蛋白通道。
  • 裁剪图像原生分辨率在不同样本间存在差异,下游模型需调整至固定输入尺寸。
  • 无官方训练/测试划分,且类别频率高度不平衡(反映源数据集采样,非平衡设计)。
  • 约3.8%的小鼠细胞(人类无)标记为Unknown

与MorphPT的关系

CellImageNet是为细胞分类视觉基础模型MorphPT提供训练语料的数据集。MorphPT仅在人类数据上进行训练,且对每个类别进行了子采样。相关资源:

搜集汇总
数据集介绍
CellImageNet 数据集图片
构建方式
CellImageNet的构建源自从10x Genomics Xenium平台公开获取的42个样本,涵盖28个人类与14个小鼠组织。研究者利用组织全景DAPI图像中的最大强度投影通道,提取核分割掩膜,并过滤掉面积过小或不完整的细胞。针对每个细胞,以核质心为中心,分别提取2.5倍和10倍两种上下文尺度的方形裁剪图像,前者捕捉精细核形态,后者反映局部组织微环境。所有裁剪图像均以原始分辨率存储,不进行预缩放,将尺寸调整的灵活性留给下游模型。
使用方法
用户可通过HuggingFace的datasets库加载数据集,指定human或mouse配置,并使用streaming=True进行流式读取。每个样本包含2.5倍与10倍的DAPI裁剪图像及包含细胞类型、组织来源等元数据的JSON字段。由于无官方训练测试划分,使用者需自行分割或参考MorphPT模型仓库中指定的子集。图像尺寸因样本而异,需在建模前统一缩放至固定输入大小。对类别不均衡,建议采用子采样或重加权策略进行模型训练。
背景与挑战
背景概述
CellImageNet是由以Ting Cao和Zhicheng Ji为代表的研究团队于2026年创建的大规模单细胞图像数据库,旨在为细胞类型分类提供标准化的视觉基准。该数据集基于10x Genomics Xenium空间转录组技术,从28个人类和14个小鼠组织样本中提取了约1000万个细胞的配对DAPI核图像,并统一为31个细胞类型标签。通过整合跨物种、多组织、多病理条件的单细胞形态学数据,CellImageNet为计算生物学领域提供了前所未有的资源,推动了细胞形态学理解与深度学习模型的融合,对精准医学和细胞基础模型研究产生了重要影响。
当前挑战
CellImageNet所解决的领域挑战在于,传统的细胞分类依赖基因表达或荧光标记,而形态学特征因缺乏大规模标注数据而难以利用。该数据集通过提供仅基于DAPI核图像的细胞类型注释,推动从形态学出发的细胞分类研究。构建过程中面临的挑战包括:从42个Xenium样本中统一不同来源的细胞类型标签为31个类别,处理原始分割掩码中噪声和微小掩码的过滤,以及确保不同组织、疾病状态下图像的多样性和代表性。此外,数据集未提供官方训练-测试划分,且类别分布高度不平衡,迫使下游模型必须自行处理采样或权重调整问题。
常用场景
经典使用场景
在细胞生物学与计算病理学交叉领域,CellImageNet作为迄今规模最为宏大的配对DAPI核图像与细胞类型注释数据库,为单细胞分辨率的图像分类任务提供了无与伦比的训练资源。研究者可基于两个互补尺度的核形态裁剪图(2.5倍紧密视图捕捉精细核形态,10倍宽视野呈现局部组织微环境),构建深度学习模型以区分31种经统一整合的细胞类型。该数据集涵盖28个人类与14个小鼠组织样本,囊括正常、癌症及退行性疾病等多种生理与病理条件,使得从复杂组织微环境中自动识别不同细胞谱系成为可能。其经典使用场景包括训练视觉基础模型(如MorphPT)以进行细胞分类,或作为预训练数据源,通过迁移学习赋能更广泛的单细胞图像分析任务。
解决学术问题
长期以来,单细胞图像分析领域受限于标注数据规模的匮乏与细胞类型标签体系的碎片化,难以训练出具备良好泛化能力的鲁棒分类模型。CellImageNet的出现从根本上缓解了这一瓶颈,其汇聚了约千万级细胞、来自42个空间转录组样本的一致化标注,使得研究者能够系统性地探索核形态与细胞身份之间的深层映射关系。该数据集解决了跨组织、跨物种、跨疾病状态下细胞类型分类的泛化难题,弥合了传统形态学观察与高通量分子分型方法之间的鸿沟。其深远意义在于推动了计算细胞表型学的范式转变——从依赖手工设计特征或特定组织模型的局限,迈向大规模自监督或监督学习驱动的通用细胞表征学习,为揭示组织异质性、疾病微环境重塑以及发育过程中的细胞动力学提供了可复现的数据基石。
实际应用
在转化研究与临床诊断的广阔前景中,CellImageNet所驱动的细胞分类模型可直接部署于空间转录组学平台(如10x Genomics Xenium)产生的组织图像分析流程,辅助病理学家在组织切片中实现高通量、标准化的细胞身份鉴定。具体而言,该数据集赋能的应用涵盖肿瘤微环境解析——区分肿瘤细胞、免疫细胞与基质细胞以推断免疫浸润状态;神经退行性疾病研究——识别激活的小胶质细胞、星形胶质细胞及病变神经元;以及再生医学领域——追踪干祖细胞与分化后代的组织分布。由于数据集仅依赖DAPI这一普适性核标记,其训练模型可轻松适配多种染色方案与成像平台,极大降低了技术门槛,使不具备单细胞转录组测序能力的实验室也能基于核形态获取细胞类型信息,加速从基础研究到临床决策的转化链条。
数据集最近研究
最新研究方向
CellImageNet以其大规模、多物种、多组织的单细胞核形态图像库,为细胞类型分类与空间转录组学分析开辟了新的前沿。当前研究的焦点在于利用该数据集训练视觉基础模型(如MorphPT),通过DAPI核染色图像学习通用细胞形态表征,从而无需基因表达信息即可实现高精度细胞分类。这一方向与空间生物学中高效、低成本细胞注释的热点需求紧密相连,尤其在处理大体积组织切片或临床FFPE样本时,纯图像的分类范式突破了传统转录组依赖的瓶颈。CellImageNet的发布推动了跨组织、跨条件的细胞形态大模型预训练,有望加速肿瘤微环境解析、神经退行性疾病研究及再生医学中的细胞图谱构建,其影响力正从计算生物学延伸至精准医学的转化实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务