遇见数据集

LUTSeg

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

LUTSeg(纵向多专家溃疡组织分割数据集)是一个用于慢性溃疡组织像素级分割的医学图像数据集。该数据集包含 141 张来自 39 名假名化患者的图像,采集时间跨度超过 21 个月,其中 111 张用于训练,30 张用于验证(按患者层级划分)。数据来源为 SIMATEC 项目中的 CO2Wounds 数据集,并由 LUTSeg 重新按患者和时间组织,新增了专家组织标注。每张图像提供二进制伤口掩码(0 和 255)以及六类组织掩码,包括背景(0)、上皮组织(1)、腐肉(2)、肉芽组织(3)、坏死组织(4)和其他(5)。此外,从 9 名患者的 46 张图像中构建了一个黄金标准子集,由五位临床医生独立标注,并提供了每位临床医生的掩码和评分者间一致性工件。注释协议要求先勾勒伤口边界,再进行像素级组织标注,黄金标准通过匿名投票和固定种子随机选择确定参考掩码。数据集还提供了多种训练/验证划分(完整、1/4、1/8、1/16)以及元数据文件。该数据集适用于伤口组织分割、纵向伤口分析、标注变异性研究和标签高效学习等研究任务。使用时需注意:数据集规模较小,仅代表特定临床和疾病背景,使用智能手机图像,存在类别不平衡和评分者间变异性,不能直接用于诊断或治疗。所有图像已去除 EXIF、GPS 等元数据,但仍需作为敏感医疗数据处理。数据集采用 CC BY 4.0 许可证发布。

LUTSeg (Longitudinal Multi-Expert Ulcer Tissue Segmentation) is a medical image dataset for pixel-level segmentation of chronic ulcer tissues. The dataset contains 141 images from 39 pseudonymized patients, collected over a period of more than 21 months, with 111 images for training and 30 for validation (split by patient). The data source is the CO2Wounds dataset from the SIMATEC project, reorganized by patient and time by LUTSeg with additional expert tissue annotations. Each image provides binary wound masks (0 and 255) and six tissue class masks: background (0), epithelial tissue (1), slough (2), granulation tissue (3), necrotic tissue (4), and other (5). Additionally, a gold standard subset is constructed from 46 images of 9 patients, independently annotated by five clinicians, with individual clinician masks and inter-rater consistency artifacts provided. The annotation protocol requires first outlining the wound boundary, then pixel-level tissue labeling, with the gold standard reference mask determined by anonymized voting and fixed-seed random selection. The dataset also provides multiple training/validation splits (full, 1/4, 1/8, 1/16) and metadata files. It is suitable for research tasks such as wound tissue segmentation, longitudinal wound analysis, annotation variability studies, and label-efficient learning. Usage notes: the dataset is small, represents only a specific clinical and disease context, uses smartphone images, exhibits class imbalance and inter-rater variability, and should not be directly used for diagnosis or treatment. All images have had EXIF, GPS, and other metadata removed, but they still require handling as sensitive medical data. The dataset is released under the CC BY 4.0 license.

创建时间:
2026-08-17
原始信息汇总

LUTSeg 数据集概述

基本信息

  • 数据集名称:LUTSeg(Longitudinal Multi-Expert Dataset for Ulcer Tissue Segmentation)
  • 许可证:CC BY 4.0
  • 规模:少于 1,000 个样本(n<1K)
  • 任务类型:图像分割(image-segmentation)
  • 数据集标签:医学、伤口护理、语义分割、纵向研究、多专家标注、麻风病、图像

核心内容

  • 数据来源:包含 141 张来自 39 名假名化患者的图像,其中训练集 111 张、验证集 30 张,按患者级别划分。
  • 纵向采集:数据采集时间跨度达 21 个月,支持纵向伤口分析。
  • 标注类别:6 类组织标签——背景、上皮组织、腐肉、肉芽组织、坏死组织、其他。
  • 金标准子集:包含 46 张来自 9 名患者的图像,由 5 名临床医生共同标注,并提供每位标注者的掩码和标注者间一致性分析文件。
  • 元数据与划分:提供 metadata.jsonl 元数据文件,以及 train.txtval.txt 划分文件和 splits/ 目录下的全量及 1/4、1/8、1/16 论文划分。

数据文件结构

  • Images/:原始 RGB 图像
  • Masks/:组织标签掩码(单通道)
  • Wound_Masks/:二值伤口掩码(值为 0 和 255)
  • Masks_RGB/:彩色可视化掩码(不可用于训练)
  • gold_standard/:多专家掩码及一致性分析文件
  • checksums.sha256:发布完整性校验清单

相关链接

标注协议与隐私保护

  • 5 名具有伤口护理和皮肤组织专业知识的临床医生参与标注,先勾画伤口边界,再进行像素级组织分类。金标准子集通过匿名投票和固定随机种子解决平票。
  • 数据遵循《赫尔辛基宣言》伦理要求,已获得书面知情同意和伦理委员会批准(批准号:05-21 和 30-11-25),并移除所有 EXIF、GPS、XMP 等元数据。

预期用途与局限性

  • 预期用途:用于伤口组织分割、纵向伤口分析、标注变异性研究和标签高效学习等研究。
  • 局限性:数据集规模较小,针对特定临床和疾病场景,使用手机拍摄图像,存在明显的类别不平衡和标注者间变异性,性能可能无法直接迁移到其他人群、机构或伤口类型。

引用说明

相关论文题为 LUTSeg: A Longitudinal Multi-Expert Dataset for Ulcer Tissue Segmentation,发表于 MICCAI 2026 第十一届 ISIC 皮肤图像分析研讨会(Spotlight 论文),最终 BibTeX 将在文献公开后补充。

搜集汇总
数据集介绍
LUTSeg 数据集图片
构建方式
LUTSeg数据集源自SIMATEC项目,整合了CO2Wounds数据集中的慢性溃疡图像,并按患者和时间进行纵向重组。该数据集包含来自39名假名化患者的141张图像,其中111张为训练图像,30张为验证图像,并在患者级别进行划分。标注过程由五名具有伤口护理和皮肤组织专业知识的临床医生执行,首先描绘伤口边界,随后进行像素级的组织类型标注,涵盖上皮组织、腐肉、肉芽组织、坏死组织及其他类型。此外,数据集还包含一个由9名患者的46张图像组成的金标准子集,该子集由全部五名临床医生独立标注,并通过匿名投票选择参考掩膜,同时提供了每名临床医生的掩膜和评分者间一致性分析所需的文件。
特点
LUTSeg数据集的独特之处在于其纵向设计和多专家标注。纵向采集跨越21个月,能够支持伤口愈合过程的时序分析。金标准子集的多专家标注和评分者间一致性数据,为研究标注变异性提供了宝贵资源。数据集提供了多种掩膜格式,包括单通道组织标签、二元伤口掩膜和彩色可视化掩膜,并明确了仅使用特定格式进行训练。此外,数据集还提供了不同监督比例的划分(全监督、1/4、1/8、1/16),支持标签高效学习的研究。所有图像均经过严格的隐私处理,移除EXIF和GPS等元数据,确保患者隐私安全。
使用方法
LUTSeg数据集可通过Hugging Face平台直接下载,并集成到TiSage代码库中使用。用户可运行`snapshot_download`命令将数据下载至本地,然后直接使用`Images`、`Masks`、`train.txt`和`val.txt`路径进行模型训练和验证。数据集还支持使用Hugging Face Datasets库,通过`metadata.jsonl`中的`*_file_name`字段关联各图像及其对应掩膜,`split`列用于区分训练和验证样本。该数据集适用于伤口组织分割、纵向伤口分析、标注变异性评估和标签高效学习等研究任务,但需注意其来源于特定临床背景和智能手机图像,迁移到其他场景时需要额外验证。
背景与挑战
背景概述
LUTSeg数据集由Carlos Hernandez等研究人员于2026年构建,旨在为慢性溃疡组织分割提供纵向、多专家标注的基准。该数据集源自SIMATEC项目,整合了CO2Wounds数据集中的图像,并新增了专家组织标签。核心研究问题聚焦于麻风病相关慢性溃疡的像素级组织分割,以支持纵向伤口分析、标注变异性研究和标签高效学习。LUTSeg由141张来自39名匿名患者的图像组成,包含二元伤口掩膜和六类组织掩膜,其中46张金标准子集由五位临床医生独立标注。该数据集被MICCAI 2026 ISIC皮肤图像分析研讨会选为Spotlight,对伤口护理与医学图像分割领域具有重要影响力,为后续研究提供了标准化基准。
当前挑战
LUTSeg面临的挑战源于其领域特性和构建过程。在领域层面,慢性溃疡组织分割本身具有显著复杂性,组织类型多样(如上皮、腐肉、肉芽、坏死),且类间差异细微,类不平衡问题严重;同时,智能手机拍摄的图像受光照、角度和分辨率影响,增加了分割难度。在构建过程中,数据集规模较小(141张图像),且患者数量有限,限制了模型的泛化能力;多专家标注引入了主观变异性,虽通过金标准子集和ICC分析加以控制,但标注协议要求精确的像素级划分,耗时且需专业知识。此外,纵向数据跨越21个月,存在伤口形态动态变化、图像质量不均等挑战,进一步加大了算法设计的复杂度。
常用场景
经典使用场景
LUTSeg数据集在医学图像分割领域具有举足轻重的地位,其核心功能在于支撑慢性溃疡组织像素级分割算法的研发与验证。该数据集汇聚了来自39位匿名患者的141幅纵向图像,涵盖上皮、腐肉、肉芽、坏死等六类关键组织,并配备了二元创面掩膜及专家标注的黄金子集,为语义分割模型的训练与评估提供了金标准基准。研究者可借此开展全监督、半监督及弱监督学习范式的对比实验,推动组织分割精度的持续提升。
解决学术问题
LUTSeg的发布恰逢其时地破解了慢性创面图像分割领域长期面临的数据稀缺与标注异质性难题。通过引入多专家独立标注和纵向追踪设计,它首次系统性地量化了标注者间变异性对分割模型性能的影响,为构建鲁棒性算法提供了理论依据。此外,患者级别的数据划分策略有效规避了数据泄露风险,使得模型泛化性能的评估更为严谨,进而推动了标签高效学习方法在该领域的探索与应用。
衍生相关工作
LUTSeg数据集催生了一系列前沿研究,其中最具代表性的当属配套发布的TiSage模型,该模型凭借其卓越性能在MICCAI 2026 ISIC研讨会上荣获Spotlight殊荣。此外,该数据集的纵向多专家标注设计激发了关于标注不确定性建模、多任务学习及时序一致性约束等方向的研究热潮。其公开的划分脚本和标注协议为社区提供了标准化基准,促进了创面分割领域从单时相静态分析向动态时序分析的范式迁移。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务