VoDaSuRe
收藏资源简介:
VoDaSuRe是由丹麦技术大学研发的大规模微CT扫描数据集,专为体数据超分辨率研究设计。该数据集包含16组生物与非生物样本(共32个扫描)的配对高低分辨率体积数据,总体素量达1940亿,涵盖木材、复合材料和骨骼等多领域微观结构。数据通过实验室CT扫描仪获取,采用4倍固定分辨率差采集,并经过配准、掩膜处理和强度匹配等严格流程处理。其核心价值在于揭示传统降采样训练与真实低分辨率扫描间的领域偏移问题,为医学影像分析、材料科学等领域的超分辨率算法提供真实基准测试平台。
VoDaSuRe is a large-scale micro-CT scanning dataset developed by the Technical University of Denmark, specifically designed for volumetric data super-resolution research. This dataset contains paired high-resolution and low-resolution volumetric data from 16 groups of biological and non-biological samples, totaling 32 scans, with an overall voxel count of 194 billion. It covers microstructures across multiple fields such as wood, composite materials and bone. The data was acquired using a laboratory CT scanner with a fixed 4-fold resolution difference, and underwent strict post-processing workflows including registration, masking and intensity matching. Its core value lies in revealing the domain shift problem between traditional downsampling-based training and real low-resolution scans, providing a realistic benchmark platform for super-resolution algorithms in fields such as medical imaging analysis and materials science.
VoDaSuRe 数据集概述
数据集基本信息
- 名称: VoDaSuRe (A Large-Scale Dataset Revealing Domain Shift in Volumetric Super-Resolution)
- 发布年份: 2026
- 发布会议: CVPR (Proceedings of the Computer Vision and Pattern Recognition Conference)
- 作者: August Leander Høeg, Sophia Wiinberg Bardenfleth, Hans Martin Kjer, Tim Bjørn Dyrby, Vedrana Andersen Dahl, Anders Dahl
- 机构: Technical University of Denmark, Kgs. Lyngby, Denmark
- 相关资源:
- 代码与数据链接: https://augusthoeg.github.io/VoDaSuRe/
- arXiv链接: https://augusthoeg.github.io/VoDaSuRe/
数据集核心特点与规模
- 核心目的: 专为真实世界体数据超分辨率任务设计的大规模数据集,旨在揭示体超分辨率中的域偏移问题。
- 数据规模: 包含16个样本,总计超过194吉体素(gigavoxels)的3D数据。
- 扫描数量: 包含32个微CT扫描(每个样本对应高分辨率和低分辨率扫描)。
- 核心特性:
- 真实多分辨率数据: 所有样本均包含扫描获得的高分辨率体积数据和低分辨率体积数据。
- 多样化微结构: 涵盖多样化的结构复杂性,包括木材、复合材料和骨骼。
- 分层数据格式: 数据以多尺度OME-Zarr格式存储,便于访问不同分辨率。
- 高效数据加载: 优化的OME-Zarr数据加载器支持大规模体数据训练和推理。
- 可复现框架: 同时发布了用于体超分辨率的PyTorch框架VoxelSR,包含多个基线模型。
数据内容与样本构成
- 样本类型与数量:
- 人类股骨: 4个
- 人类椎骨: 4个
- 动物骨骼: 1个(牛骨)
- 木材样本: 5个树种(竹子、柏木、榆木、橡木、落叶松)
- 复合材料: 2个(中密度纤维板、纸板层压板)
- 数据维度概览: 提供了每个样本的高分辨率、低分辨率和配准后数据的体积形状(体素数),以及训练/测试切片划分。
数据预处理流程
- 数据采集: 对同一样本进行多分辨率嵌套CT扫描。
- 核心步骤:
- 将低分辨率数据裁剪并配准到降采样后的高分辨率体积上。
- 对低分辨率和高分辨率体积进行掩膜处理并匹配其强度直方图。
- 配准方法: 使用ITK-Elastix工具箱,采用仿射变换模型将低分辨率体积配准到降采样后的高分辨率体积,允许轻微形变以确保体素级对应。
- 存储格式: 所有扫描数据保存为OME-Zarr格式,最多包含四个分辨率级别,并为高分辨率、低分辨率和配准数据分别设立单独的组。
主要研究发现
- 域偏移问题:
- 在真实低分辨率数据上使用逐像素损失训练的超分辨率模型会产生过度平滑的预测,无法恢复精细结构。
- 在合成降尺度数据上训练的模型在合成数据上表现良好,但无法泛化到真实获取的体数据。
- 在真实低分辨率数据上评估时,基于合成数据训练的模型会产生结构“幻觉”。
- 研究表明,对于真实世界应用,基于合成数据训练模型的实践需要重新评估。
- 合成数据与真实数据的差异: 通过计算总变差量化高频信息损失,发现使用扫描低分辨率数据进行的预测总变差更低,表明真实低分辨率数据的超分辨率是比上采样降尺度低分辨率体积更困难的问题。
基准测试
- 评估模型: 在VoDaSuRe数据集上评估了广泛的先进超分辨率模型,包括2D和体超分辨率模型。
- 核心观察: 在合成低分辨率数据上训练的模型能够恢复大部分高频信息,而相同模型在真实低分辨率数据上训练则会产生过度平滑的微结构“幻觉”。

- 1VoDaSuRe: A Large-Scale Dataset Revealing Domain Shift in Volumetric Super-Resolution丹麦技术大学 · 2026年



