遇见数据集

CALHippo

收藏
github2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

CALHippo数据集是一个用于人类海马体的细胞类型解析实例分割和基于密度的介观重建的可重复流程。它包含预处理的高分辨率作物、分类的细胞注释和介观点云,可用于跳过数据预处理、分割和分类步骤,从BigBrain组织切片生成生物合理的3D细胞点云。

The CALHippo dataset is a reproducible workflow for cell type-resolved instance segmentation and density-based mesoscopic reconstruction of the human hippocampus. It includes preprocessed high-resolution crops, classified cell annotations, and mesoscopic point clouds, which eliminates the need for data preprocessing, segmentation and classification steps to generate biologically plausible 3D cellular point clouds from BigBrain tissue sections.

创建时间:
2026-06-19
原始信息汇总

数据集概述:CALHippo Framework

CALHippo Framework 是与 CALHippo 数据集 相关联的官方代码库,提供了一个多尺度工作流程,用于从 BigBrain 组织学切片生成生物可信的 3D 细胞点云,桥接微观细胞实例与宏观脑结构。

核心功能与流程

该框架包含一个完整的处理管线,主要步骤为:

  1. 预处理:处理原始高分辨率(HR)和低分辨率(LR)的 BigBrain 切片。
  2. 细胞分割与分类:在高分辨率切片中分割并分类细胞。
  3. 标注映射:将高分辨率标注映射到低分辨率空间。
  4. 密度模型训练:训练低分辨率密度模型。
  5. 全片推理:对整个切片进行低分辨率推理。
  6. 点云重建:重建 3D 点云输出。

数据集内容

已发布的 CALHippo 数据集(可通过 https://ditto.ing.unimore.it/calhippo/ 获取)包含:

  • 24 张高分辨率 BigBrain 切片,带有 CA1-CA4 区域的细胞标注。
  • 一个中尺度点云
  • 预处理的 HR 裁剪图、分类的细胞标注

使用此数据集可以跳过 HR 数据预处理、分割和分类步骤。

技术环境与依赖

使用路径

用户可根据目标选择以下路径:

  • 直接使用已发布数据集:下载 CALHippo 数据集并跳过 HR 管线。
  • 复现完整流程:从原始数据开始,按照数据设置和管线文档进行操作。

数据布局

数据目录遵循 <DATA_ROOT> 约定,关键文件夹包括:

  • 原始输入<DATA_ROOT>/raw/high_res, .../low_res, .../masks
  • 预处理输出<DATA_ROOT>/input/all_regions, .../single_regions
  • 管线输出<DATA_ROOT>/output/segmentation, .../classification, .../lr_density_dataset
  • 密度估计器训练<DATA_ROOT>/density_estimator_training
  • 模型文件<DATA_ROOT>/models
  • 最终点云<DATA_ROOT>/output/mesoscale_reconstruction/<PREDICTIONS_NAME>/point_cloud.csv

区域名称

维护的区域名称为:RCA1, RCA2, RCA3, RCA4

许可证与使用条款

  • 源代码:Apache License 2.0。
  • 模型权重、数据集、衍生标注等:Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0),仅限非商业学术研究使用。
  • 第三方代码:包括 Cellpose、HoVer-Net、InstanSeg、StarDist 等,受其原始许可证约束。
  • UNI2-h 权重:不随本仓库分发,用户需自行向上游提供者申请访问权限。

引用信息

如果您使用了该数据集或代码,请引用以下论文:

@inproceedings{2026MICCAI_calhippo, title={CALHippo: Cell Segmentation for Neuronal Density Inference in the Human Hippocampus}, author={Casari, Giovanni and Candeloro, Ettore and Gandolfi, Daniela and Mapelli, Jonathan and Bolelli, Federico and Grana, Costantino}, year={2026}, month={June}, book={Medical Image Computing and Computer Assisted Intervention – MICCAI 2026}, booktitle={Medical Image Computing and Computer Assisted Intervention – MICCAI 2026}, venue={Strasbourg, France}, keywords={Human Brain, Cell Segmentation, Density Estimation} }

搜集汇总
数据集介绍
CALHippo 数据集图片
构建方式
在海马体组织结构的精细解析中,细胞层面的准确标注对于理解其功能至关重要。CALHippo数据集基于BigBrain组织学切片的高分辨率与低分辨率图像构建而成。研究者首先对高分辨率图像进行细胞分割与分类,生成CA1-CA4区域的细胞级注释。随后,这些高分辨率注释被映射至低分辨率空间,用以训练密度估计模型。最终,通过整片低分辨率推理与三维点云重建,生成具有生物学合理性的中尺度细胞点云。整个流程整合了从微观细胞实例到宏观脑区结构的跨尺度工作流。
特点
CALHippo数据集的核心特质在于其跨尺度的统一性与生物可解释性。它提供了包含24张高分辨率BigBrain切片在内的预处理数据,涵盖CA1至CA4区域的细胞注释,并已生成完整的中尺度点云。数据集中囊括了公开可用的模型权重,支持Cellpose、HoVer-Net、StarDist等多种前沿分割架构。其数据布局清晰规范,原始输入、预处理输出、模型训练记录及最终重建结果均按统一目录结构组织,极大便利了研究者对数据源的追溯与复用。
使用方法
使用CALHippo数据集时,研究者首先应通过提供的脚本(setup_data.py)配置数据根目录并导入压缩包,即可跳过耗时的高分辨率预处理与分割阶段。若需快速复现核心结果,可直接利用已发布的细胞注释及点云进行下游分析。对于希望理解或扩展完整流程的用户,数据集附带了详尽的数据设置指南与流水线文档,详细说明了从原始数据下载到低分辨率推理、点云重建的每一步骤。此外,官方推荐使用uv包管理器安装依赖,并提供了统一的配置路径以适配不同研究目标。
背景与挑战
背景概述
CALHippo数据集由Giovanni Casari与Ettore Candeloro等研究人员于2026年创建,其成果已被MICCAI 2026会议接收。该数据集聚焦于人类海马体这一关键脑区,致力于解决微观细胞实例与宏观脑架构之间的跨尺度映射问题。核心研究问题在于如何从BigBrain组织学切片的高分辨率图像中精准分割并分类CA1至CA4区域的细胞,进而生成具有生物学合理性的三维细胞点云。CALHippo的发布为神经科学领域提供了首个涵盖完整海马亚区的细胞级标注资源,显著推动了脑图谱构建与神经退行性疾病研究的发展,其影响力已延伸至医学图像计算与计算神经科学等交叉领域。
当前挑战
CALHippo所应对的核心挑战在于突破传统组织学分析中细胞分辨率与全脑尺度之间的鸿沟。高分辨率图像虽能呈现细胞细节,但处理海量数据并实现跨切片匹配极具难度;低分辨率图像虽覆盖广泛,却难以捕捉单细胞形态特征。构建过程中面临多重困难:需从BigBrain的原始巨大切片中手工校正感兴趣区域掩膜,确保CA亚区边界的准确性;高分辨率细胞分割需整合Cellpose、HoVer-Net等多种模型,并克服不同染色与切片角度带来的泛化问题;从高分辨率标注到低分辨率密度场的映射需精心设计坐标系与仿射变换规则,以消除空间误差;最终生成的三维点云需在有限切片间插值并保持生物学可解释性,对计算方法提出了严苛要求。
常用场景
经典使用场景
在海马体神经科学研究中,CALHippo数据集为从组织学图像中解析细胞尺度的三维空间分布提供了标准化的多尺度框架。其最经典的用法是利用24张高分辨率BigBrain切片上人工标注的CA1-CA4区域细胞实例,结合低分辨率全切片密度预测模型,生成包含细胞类别信息的介观尺度点云。研究者可直接调用已发布的预处理高分辨率图像、分类注释和最终点云,跳过耗时的数据清洗与分割阶段,专注于密度估计模型训练或点云空间分析。该框架支持从原始图像到三维细胞库的完整复现流程,亦可作为独立模块嵌入其他脑区研究。
解决学术问题
该数据集创新性地解决了从组织学切片到三维细胞图谱构建中的跨尺度对齐难题。传统方法受限于高分辨率图像的小视场与低分辨率全切片间的信息鸿沟,难以在宏观脑区尺度上保持细胞分辨率的空间保真度。CALHippo通过设计HR-LR坐标映射协议与密度回归策略,弥合了显微实例与全脑结构之间的尺度断裂,首次实现了海马体CA亚区中不同类别神经元的三维重建与定量分析。这一突破极大推动了计算神经解剖学发展,为验证细胞分布假说、探索海马体层状结构异质性提供了高精度基准。
衍生相关工作
CALHippo的出现催生了多个方向的延伸工作。在方法学层面,其多尺度框架启发了将细胞分割模型(如Cellpose、HoVer-Net)与密度回归网络(如UNet变体)串联的混合架构研究,部分工作进而探索了基于注意力机制的跨分辨率特征融合策略。在神经科学领域,已有团队基于该数据集构建了海马体CA子区细胞类型特异性空间分布图,并以此为输入参数仿真局部场电位动态。数据集中的HR-LR坐标约定还成为后续BigBrain数据处理社区的推荐基准,推动了全脑尺度细胞密度图谱的标准化生成流程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务