遇见数据集

Pleural-Line-Segmentation-Masks

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集名为Pleural-Line Masks with Stanford LUS Frames,是一个用于医学图像分析的开源数据集,主要支持图像分割和视频分类任务。其核心内容包括胸膜线掩膜及对应的肺部超声图像帧,旨在推动解剖引导的肺部超声视频分类研究。掩膜数据通过两种方式生成:一是由四位人类标注者利用sam2模型进行点提示标注并通过视频聚合得到;二是由U-Net模型预测生成,并经过人工审查和验证。超声图像帧源自公开的Stanford LUS数据集,以预提取的帧形式提供,确保了帧与掩膜的正确配对,简化了数据处理。数据集按患者和扫描区域组织,每个患者-区域目录对应一个视频序列,包含图像帧文件和掩膜文件。关键元数据文件包括:`split.csv`定义患者级别的交叉验证划分,确保同一患者的所有视频位于同一折叠;`data_patient_zone_with_labels.csv`记录每个患者-区域视频的唯一标识符、视频级分类标签(0:健康,1:B线,2:实变,3:B线和实变)及帧目录路径;`masks_info.csv`索引所有可用的胸膜线掩膜,包括有效性标志、文件路径和来源标注者(-1表示U-Net预测后验证,0-3表示人类标注者)。该数据集适用于胸膜线自动分割、基于解剖先验的超声视频分类模型开发、注意力机制监督等研究场景,支持实验复现,但仅用于研究,不应用于临床诊断。

The dataset is named Pleural-Line Masks with Stanford LUS Frames and is an open-source dataset for medical image analysis, primarily supporting image segmentation and video classification tasks. Its core content consists of pleural line masks and corresponding lung ultrasound image frames, aiming to promote anatomically-guided lung ultrasound video classification research. Mask data is generated in two ways: first, by four human annotators using the sam2 model for point-prompt annotation and aggregated via video; second, by U-Net model predictions, followed by manual review and validation. Ultrasound image frames are sourced from the public Stanford LUS dataset, provided as pre-extracted frames to ensure correct pairing with masks and simplify data processing. The dataset is organized by patient and scan zone, with each patient-zone directory corresponding to a video sequence containing image frame files and mask files. Key metadata files include: `split.csv` defines patient-level cross-validation splits, ensuring all videos from the same patient are in the same fold; `data_patient_zone_with_labels.csv` records unique identifiers, video-level classification labels (0: healthy, 1: B-lines, 2: consolidation, 3: B-lines and consolidation), and frame directory paths for each patient-zone video; `masks_info.csv` indexes all available pleural line masks, including validity flags, file paths, and source annotators (-1 for U-Net predictions after validation, 0-3 for human annotators). This dataset is suitable for research scenarios such as automatic pleural line segmentation, development of ultrasound video classification models based on anatomical priors, and supervision of attention mechanisms, supporting full experimental reproducibility, but is intended for research only and not for direct clinical diagnosis.

创建时间:
2026-07-19
原始信息汇总

数据集概述:Pleural-Line Masks with Stanford LUS Frames

基本信息

  • 数据集名称:Pleural-Line Masks with Stanford LUS Frames
  • 语言:英语
  • 任务类别:图像分割、视频分类
  • 标签:医学影像、超声、肺部超声、胸膜线
  • 许可证:其他(非标准)

数据集内容

该数据集包含胸膜线掩膜及其对应的肺部超声帧,用于解剖引导的视频分类。掩膜集包括:

  • 由四位人类标注者通过 SAM2 模型点提示和视频聚合创建的掩膜
  • 由 U-Net 预测并经审核验证的掩膜
  • 可复现训练流程所需的元数据

超声帧来源于开放的 Stanford LUS 数据集,以预提取帧的形式提供,以保留帧-掩膜配对关系,并避免重复视频预处理。

目录结构

每个患者-区域目录代表一个视频。帧直接存储在区域目录中,掩膜存储在 masks/masks 下。

<dataset_root>/ ├── <patient_id>/ │ └── <zone_id>/ │ ├── <frame files> │ └── masks/ │ └── <mask files> ├── split.csv ├── data_patient_zone_with_labels.csv └── masks_info.csv

并非每一帧都有有效掩膜,无掩膜的帧仍作为视频序列的一部分使用。

元数据文件

split.csv

定义患者级别的交叉验证折。

列名 描述
patientid 患者标识符
split 交叉验证折

同一患者的所有视频保持在同一个折中。

data_patient_zone_with_labels.csv

每个患者-区域视频对应一行。

列名 描述
Patient_Zone_ID 患者-区域视频的唯一标识符
label 视频级别的分类标签
frames_path 相对于数据集根的帧目录路径

分类标签包括:

标签 类别
0 健康
1 B线
2 实变
3 B线和实变

masks_info.csv

索引可用的胸膜线掩膜。

列名 描述
patient_zone_id 对应 Patient_Zone_ID 的患者-区域标识符
valid 掩膜是否通过验证并可使用
mask_path 掩膜图像的路径
annotator 掩膜来源

标注者取值含义:

含义
-1 由 U-Net 预测,经审核验证
0-3 人类标注者 0-3

valid 值为有效的掩膜应用于掩膜监督训练。

预期用途

该数据集旨在用于以下研究:

  • 胸膜线分割
  • 解剖引导的肺部超声分类
  • 注意力监督
  • 附带实验的可复现性

不适用于直接临床诊断或未经独立验证和监管审查的部署。

数据来源

超声帧来自 Stanford LUS 数据集,为方便复现而包含。原始数据集条款仍然适用。胸膜线掩膜及相关元数据是为附属研究项目创建的。

参考文献

  • 论文:https://arxiv.org/abs/2607.17551
  • 代码:https://github.com/Alya-Almsouti/LUS-video-classification
搜集汇总
数据集介绍
Pleural-Line-Segmentation-Masks 数据集图片
构建方式
本数据集基于公开的斯坦福肺部超声(Stanford LUS)数据集中的视频帧,通过两种途径构建胸膜线掩膜:其一,由四位人类标注员利用SAM2模型进行点提示标注,并结合视频帧聚合策略生成高质量掩膜;其二,采用U-Net模型进行预测,随后经人工审核与验证以提升准确性。所有掩膜均保留了与原始超声帧的严格配对关系,并附带复现训练流程所需的完整元数据,从而确保数据集的可靠性与可复现性。
特点
该数据集的核心特色在于其多层次的掩膜来源与结构性标注体系。掩膜集不仅涵盖人工与模型预测的混合标注,还通过‘valid’字段明确标识每个掩膜的可用性,确保用户能够筛选出经过验证的高质量样本。此外,元数据文件精细地管理了患者级交叉验证划分、视频级分类标签(健康、B线、实变及混合类别)以及掩膜索引信息,为解剖引导的视频分类研究提供了结构清晰、便于复用的数据基础。
使用方法
数据集适用于胸膜线分割、解剖引导的肺部超声视频分类及注意力监督等研究任务。使用时,用户可依据‘split.csv’文件进行患者层次交叉验证,利用‘data_patient_zone_with_labels.csv’获取视频级标签与帧路径,并通过‘masks_info.csv’筛选出‘valid’值为真的掩膜进行掩膜监督训练。所有帧与掩膜按患者-区域目录组织,便于加载与处理,相关代码及论文已在GitHub与arXiv上开源,支持研究复现。
背景与挑战
背景概述
肺超声作为床旁快速评估心肺功能的重要工具,在急诊与重症监护领域具有不可替代的价值,而胸膜线作为肺超声影像中的关键解剖标志,其准确分割是后续病理分类的基础。Pleural-Line-Segmentation-Masks数据集由Mohammad Yaqub团队联合斯坦福大学研究人员于2026年创建,核心研究问题在于如何利用胸膜线的解剖先验知识引导肺超声视频分类,以提升模型对B线、肺实变等异常模式的识别能力。该数据集基于开源Stanford LUS数据库的超声帧,整合了四位人类标注者通过SAM2模型结合视频聚合产生的掩膜,以及经人工验证的U-Net预测结果,为解剖引导的注意力监督和可复现研究提供了标准化基准,对推动医学影像分析中解剖结构先验与深度学习融合的研究范式具有重要影响力。
当前挑战
该数据集所解决的领域核心挑战在于肺超声视频分类中缺乏解剖结构先验引导,传统方法仅依赖全局帧特征,难以区分B线与实变等贴邻性病变,导致分类混淆和泛化性不足。构建过程中面临多重技术挑战:首先,胸膜线作为薄层高回声结构,在超声图像中对比度低且常被伪影干扰,精确标注需要专业临床知识,四位标注者间的一致性难以保证;其次,视频帧与掩膜的高效配对要求帧级时间对齐,而部分帧因质量不合格缺失有效掩膜,需决定是否剔除或以序列方式保留;最后,跨患者交叉验证拆分必须保持同一患者所有视频片段不跨折,以防数据泄露,同时需构建可复现的元数据索引结构以协调多种标注来源(人工与模型预测)的混用逻辑。
常用场景
经典使用场景
Pleural-Line-Segmentation-Masks数据集的核心应用场景在于为肺超声影像中的胸膜线分割任务提供高质量的标注数据。胸膜线作为肺超声图像中关键解剖结构,其精确分割是评估肺部健康状态的基础。该数据集包含由四名人类标注者通过SAM2模型结合视频聚合生成的掩膜,以及经U-Net模型预测并人工审核后的掩膜数据,从而为深度学习驱动的胸膜线自动分割算法提供了可靠的训练与验证基准。研究者可通过该数据集开发和评估各类图像分割模型,尤其是在医学影像领域广泛应用的U-Net及其变体架构。
衍生相关工作
围绕该数据集已衍生出若干具有影响力的经典工作。首先,基于U-Net的胸膜线预测模型为该领域提供了强基线的分割基准;其次,伴随数据集发布的论文提出了层级感知与解剖引导学习的肺超声视频分类框架,展示了如何利用胸膜线掩膜监督分类网络的空间注意力分布。此外,SAM2模型的点提示与视频聚合策略被创新性地应用于胸膜线掩膜的半自动生成,为大规模医学标注开辟了高效路径。这些工作共同形成了一个从数据标注、模型训练到临床应用的技术生态链,深刻影响了肺超声智能分析的后续研究范式。
数据集最近研究
最新研究方向
在当前医学影像分析的前沿探索中,肺超声凭借其无辐射、便携性等优势,在危重症及呼吸系统疾病诊断中扮演着日益关键的角色。该数据集聚焦于胸膜线这一解剖标志的精准分割,将其与视频级肺部超声分类任务深度融合,开辟了基于解剖引导的弱监督与注意力监督学习新范式。结合大规模基础模型(如SAM 2)与人工校验的标注流程,不仅提升了掩膜质量与标注效率,更为跨患者、跨病种(如健康、B线、实变及其组合)的视频分类提供了可复现的标准化基准。此项工作呼应了近期可解释AI与解剖先验知识嵌入临床影像分析的热潮,为构建更鲁棒、更可信的肺超声自动诊断系统奠定了宝贵的数据与实验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务