遇见数据集

LUTSeg

收藏
arXiv2026-08-26 更新2026-08-28 收录
数据链接:
官方服务:

资源简介:

LUTSeg是一个为麻风病相关慢性溃疡组织分割而构建的纵向多专家数据集,由阿卜杜拉国王科技大学等机构联合创建。该数据集包含141张来自39名患者的临床图像,覆盖上皮、腐肉、肉芽、坏死及其他五类组织,并设有46张图像的多专家黄金标准子集以评估标注一致性。数据采集历时21个月,由医护人员使用智能手机拍摄,并由五位专科医师依据标准化流程进行像素级标注。该数据集旨在解决被忽视疾病中组织级标注稀缺的问题,为慢性溃疡监测与治疗决策提供可靠基准,并推动半监督组织分割方法的发展。

LUTSeg is a longitudinal multi-expert dataset constructed for tissue segmentation of leprosy-related chronic ulcers, jointly developed by King Abdullah University of Science and Technology (KAUST) and other collaborating institutions. This dataset contains 141 clinical images from 39 patients, covering five types of tissues: epithelium, slough, granulation tissue, necrosis and others. It also includes a multi-expert gold standard subset of 46 images for evaluating annotation consistency. Data collection spanned 21 months, with images captured by medical staff using smartphones and annotated at pixel level by five specialist physicians following standardized workflows. This dataset aims to address the scarcity of tissue-level annotations in neglected diseases, provide a reliable benchmark for chronic ulcer monitoring and treatment decision-making, and advance the development of semi-supervised tissue segmentation methods.

创建时间:
2026-08-26
原始信息汇总

LUTSeg 数据集概述

基本信息

  • 数据集全称:LUTSeg (Longitudinal Multi-Expert Dataset for Ulcer Tissue Segmentation)
  • 核心任务:溃疡组织分割(Ulcer Tissue Segmentation)
  • 论文状态:第十一届ISIC皮肤图像分析研讨会(MICCAI 2026)Spotlight论文
  • 数据许可:CC BY 4.0
  • 代码许可:MIT License

数据集特点

LUTSeg是一个纵向多专家溃疡组织分割数据集,具备以下关键特征:

  1. 纵向性:按患者和时间维度对数据进行了重新组织
  2. 多专家标注:包含多位专家的组织注释,支持专家间一致性分析
  3. 半监督学习:专为低标签场景下的组织分割设计,支持半监督训练

数据来源与构成

  • 数据集基于CC BY 4.0许可的SIMATEC/CO2Wounds源影像整理而成
  • 按患者和时间维度重新组织影像,并添加了新的专家组织标注
  • 完整数据集可从Hugging Face平台获取(ksanchez84/LUTSeg
  • 数据目录结构包括:
    • Images/:影像数据
    • Masks/:分割掩码
    • train.txt:训练集划分
    • val.txt:验证集划分
  • 提供训练和验证分区,无独立测试集
  • 同时提供一个小的去标识化示例子集(LUTSeg/examples/

配套方法(TiSage)

数据集配套了TiSage半监督组织分割方法,该方法基于:

  • EMA教师-学生分割框架
  • 多尺度MedSigLIP语义引导
  • 像素自适应融合
  • 置信度加权软监督

使用与复现

  • 推荐Python 3.10环境
  • 验证环境:Python 3.10.19、PyTorch 2.6.0、torchvision 0.21.0、CUDA 12.4、Transformers 5.1.0
  • 提供完整的复现代码和配置(method/目录)
  • 包含结果验证脚本(verify_reported_results.py
  • 支持的基线方法:FixMatch、UniMatch-V2、DeepLabV3+
  • 提供4个训练好的分割检查点(约866MB/个),可从Hugging Face获取
  • 训练需要NVIDIA GPU支持

引用信息

数据集论文被MICCAI 2026第十一届ISIC皮肤图像分析研讨会接收(Spotlight),引用格式为BibTeX,数据集使用CC BY 4.0许可,代码使用MIT许可。

搜集汇总
数据集介绍
LUTSeg 数据集图片
构建方式
LUTSeg数据集针对慢性溃疡组织像素级标注稀缺及麻风病等被忽视疾病缺乏纵向数据的困境,由专业临床医生在标准化标注平台完成构建。数据采集涵盖21个月内39例麻风病相关溃疡患者的141幅随访图像,每幅图像均包含二值创面掩膜及五种组织类别(上皮、腐肉、肉芽、坏死及其他)的像素级分割标注。为避免数据泄露,按患者级别划分训练与评估子集。特别地,选取9例组织多样性较高的患者构成46幅图像的金标准子集,由五位专家独立重复标注,用于评估标注者间一致性,并通过共识投票生成每幅图像的参考掩膜。
特点
LUTSeg是首个针对麻风病溃疡的纵向、多专家像素级组织分割数据集,其独特性体现在多个层面。纵向设计支持跨随访时间的组织构成变化分析,为疾病进展监测提供依据。金标准子集包含五位临床医生的独立标注,定量揭示了不同组织类别的标注者间一致性差异(如坏死组织ICC=0.63,上皮组织仅ICC=0.38),凸显了创面组织表型判定的固有主观性。此外,数据集采用统一的标注协议,涵盖临床实践中的五类组织,且‘其他’类别的设置灵活应对难分类的异质性区域,进一步提升了数据集的临床适用性和标注鲁棒性。
使用方法
LUTSeg数据集可直接用于慢性溃疡组织分割模型的监督训练与评测,其标准的图像、创面掩膜和像素级组织标签格式兼容主流语义分割框架。基于纵向样本,研究者可开发时间感知模型以追踪组织演变。金标准子集支持标注者间一致性分析及多专家标签融合策略的研究。鉴于标注成本高,数据集适用于半监督学习场景,如论文中提出的TiSage框架,在低标注比例(1/4、1/8、1/16)下利用未标注图像和预训练医学视觉语言模型提升分割性能。数据与代码已公开,便于复现与扩展。
背景与挑战
背景概述
LUTSeg数据集由沙特阿卜杜拉国王科技大学(KAUST)与哥伦比亚合作医院于2026年联合创建,聚焦麻风病相关慢性溃疡的组织分割这一长期被忽视的医学影像难题。该数据集包含39名患者的141张纵向随访图像,由五位临床专家对五种组织类型(上皮、腐肉、肉芽、坏死及其他)进行像素级标注,并特别构建了46张图像的多专家黄金标准子集,用于评估标注者间一致性。作为首个针对麻风溃疡的多组织纵向数据集,LUTSeg填补了该领域缺乏高质量组织级标注数据的空白,为慢性伤口监测、治疗决策支持及半监督分割算法研究提供了关键资源。
当前挑战
LUTSeg面临的挑战涵盖领域与构建双重层面。领域层面,慢性溃疡组织分割长期受限于像素级标注的高昂成本与主观性,多组织数据集匮乏,且麻风病作为被忽视的热带疾病,专家资源稀缺,纵向监测数据尤为不足;此外,组织类型间边界模糊、类别不均衡等问题加剧了模型学习的难度。构建层面,研究团队需协调五位临床专家进行独立标注,建立标准化协议以控制质量,并通过患者级划分防止数据泄漏;同时,黄金标准子集的共识获取需处理标注者间的分歧,如Dice系数最低仅0.187,反映出组织表型判定的内在变异性,这对算法设计提出了不确定性感知的需求。
常用场景
经典使用场景
LUTSeg数据集作为针对麻风病相关慢性溃疡的纵向、多专家标注的像素级组织分割数据集,其经典使用场景在于推动医学图像分析领域中对创伤组织精细分割的研究。该数据集提供了141张来自39名患者的溃疡图像,涵盖五种组织类别,并包含由五位临床专家独立标注的金标准子集,为评估分割算法在真实临床条件下的性能提供了基准。研究者常利用该数据集开展有监督与半监督语义分割模型的训练与验证,尤其关注低标注率场景下的平均交并比(mIoU)与Dice系数等指标,从而检验算法在像素级组织分类中的准确性与鲁棒性。
解决学术问题
在学术研究中,LUTSeg数据集回应了慢性溃疡组织分割领域长期存在的标注稀缺与多组织类别数据不足的难题,尤其填补了被忽视热带病(如麻风病)相关溃疡的纵向数据空白。该数据集通过提供多专家标注的金标准子集和详细的标注协议,解决了研究者难以量化标注者间变异性及评估算法一致性的问题。其引入的纵向随访结构支持对创伤愈合过程的时间动态分析,为开发时序感知的分割模型及半监督学习框架(如TiSage)提供了数据基础,推动了在标注成本高昂条件下的高效医疗影像分析研究。
衍生相关工作
LUTSeg数据集的发布催生了一系列相关研究工作,其中最具代表性的是其基准方法TiSage,一种融合冻结医学视觉语言模型(MedSigLIP)的多尺度语义先验与教师-学生框架的半监督组织分割框架。TiSage在低标注率设置下显著提升了对模糊组织和稀有类别的分割性能,尤其在腐肉与肉芽组织上获得了较大增益。此外,该数据集的标注协议与金标准子集为后续研究标注者一致性分析、模型不确定性量化及多专家学习等方向提供了基础,推动了医学图像分割领域在标注稀缺与临床歧义条件下的算法创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务