遇见数据集

nutriderm-dataset

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

NutriDermAI数据集是一个开源皮肤病学数据集,旨在支持名为NutriDermAI的多模态人工智能系统。该系统结合ABCDE(不对称性、边界、颜色、直径、演变)可解释性框架与视觉问答(VQA)能力,以辅助皮肤病分析。该数据集是VJTI孟买2026年一项M.Tech学位论文的组成部分。数据来源包括:ISIC 2016、ISIC 2017和ISIC 2018的皮肤镜图像及其对应的分割掩码;PAD-UFES-20的临床图像及相关元数据;以parquet格式存储的视觉问答(VQA)数据,分为训练集、验证集和测试集;以及标记为MARIA的parquet文件。数据集整体规模在10万到100万样本之间,适用于图像分割和视觉问答等机器学习任务,主要聚焦于皮肤病变(如黑色素瘤)的分析与诊断。

NutriDermAI dataset is an open-source dermatology dataset designed to support the multimodal artificial intelligence system named NutriDermAI. This system integrates the ABCDE (Asymmetry, Border, Color, Diameter, Evolving) interpretability framework and visual question answering (VQA) capabilities to assist dermatological analysis. This dataset is a component of an M.Tech thesis from VJTI Mumbai in 2026. Its data sources include: dermoscopic images and their corresponding segmentation masks from ISIC 2016, ISIC 2017 and ISIC 2018; clinical images and associated metadata from PAD-UFES-20; visual question answering (VQA) data stored in Parquet format, split into training, validation and test sets; and Parquet files labeled MARIA. The overall scale of the dataset ranges from 100,000 to 1,000,000 samples. It is applicable to machine learning tasks such as image segmentation and visual question answering, and mainly focuses on the analysis and diagnosis of skin lesions (e.g., melanoma).

创建时间:
2026-07-18
原始信息汇总

数据集概述:NutriDermAI

数据集名称:NutriDermAI Dataset
许可证:CC-BY-4.0
任务类别:图像分割(image-segmentation)、视觉问答(visual-question-answering)
标签:皮肤科(dermatology)、皮肤病变(skin-lesion)、ABCDE、黑色素瘤(melanoma)、多模态(multimodal)
数据规模:100,000 至 1,000,000 条样本


数据集背景

该数据集是为 NutriDermAI 项目构建的,旨在开发一个面向皮肤科的多模态AI系统,支持ABCDE可解释性以及视觉问答(VQA)。该项目为VJTI Mumbai 2026年的硕士论文研究,由 Prof. Manasi Kulkarni 指导。


数据集内容

数据集包含以下子文件夹,覆盖多个来源的皮肤影像与标注数据:

文件夹 内容
ISIC2016/ ISIC 2016 皮肤镜图像 + 掩膜
ISIC2017/ ISIC 2017 皮肤镜图像 + 掩膜
ISIC2018/ ISIC 2018 皮肤镜图像 + 掩膜
PAD-UFES-20/ PAD-UFES-20 临床图像 + 元数据
Stage7/ VQA 的 Parquet 文件(训练/验证/测试集)
it_fusion_modular_project/ MARIA 的 Parquet 文件

使用方式

通过 Hugging Face datasets 库加载数据集(以训练集为例):

python from datasets import load_dataset ds = load_dataset("akhil06/nutriderm-dataset", split="train")

搜集汇总
数据集介绍
nutriderm-dataset 数据集图片
构建方式
NutriDermAI数据集依托多模态人工智能系统构建,专为皮肤科领域设计。其构建过程融合了多个权威公开资源,包括ISIC 2016、ISIC 2017与ISIC 2018的皮肤镜图像及其对应掩膜,以及PAD-UFES-20临床图像与元数据。此外,数据集纳入了视觉问答(VQA)数据集(以Parquet格式存储于Stage7文件夹),并整合了MARIA框架下的多模态融合项目文件。通过将图像分割任务与VQA任务相结合,数据集实现了皮肤病变的细粒度标注与语义理解的双重覆盖,为后续多模态学习奠定了结构化基础。
特点
该数据集的核心特点在于多模态整合与可解释性机制的嵌入。它不仅包含丰富的皮肤镜与临床图像,还提供了完整的ABCDE(不对称性、边界、颜色、直径、演化)可解释性标注,使得模型不仅能进行皮肤病变分割,还能输出符合临床诊断逻辑的推理路径。数据集包含超过10万条样本,横跨分割与问答双重任务,且采用统一的Parquet格式存储结构化数据,便于高效加载与多任务协同训练。这种设计显著提升了模型在皮肤病诊断中的透明度与可信度。
使用方法
使用该数据集十分便捷,用户可通过HuggingFace的datasets库直接加载,例如执行`ds = load_dataset("akhil06/nutriderm-dataset", split="train")`即可获取训练集。数据集按任务组织为不同文件夹,其中ISIC系列适用于图像分割任务,而Stage7内含有预划分的VQA训练、验证与测试文件。用户在加载后可根据自身需求选择子任务对应的数据路径,或通过多模态融合模块实现端到端训练。建议结合Python的深度学习框架(如PyTorch)与数据加载器,以充分利用其结构化特性进行模型微调与评估。
背景与挑战
背景概述
皮肤病变的早期诊断对于黑色素瘤等恶性疾病的治疗具有至关重要的意义,然而传统诊断方法高度依赖专家经验,难以在大规模筛查中普及。在此背景下,NutriDermAI数据集于2026年由印度VJTI Mumbai的M.Tech项目团队在Manasi Kulkarni教授的指导下创建,旨在推动多模态人工智能系统在皮肤科领域的应用。该数据集整合了ISIC 2016、2017、2018等经典皮肤镜图像及PAD-UFES-20临床图像,并引入视觉问答(VQA)与ABCDE解释性标注,为核心研究问题——如何构建具备可解释性的多模态皮肤病变诊断模型——提供了丰富的数据基础。凭借其超过10万样本的规模和多任务结构,NutriDermAI为皮肤病变分割、分类及可解释性研究树立了新的基准,显著提升了领域内模型的可信度与实用性。
当前挑战
当前皮肤病变诊断面临两大核心挑战:一是多模态数据的异构性与标注一致性难题。NutriDermAI需将来自不同来源(如ISIC系列和PAD-UFES-20)的皮肤镜图像与临床图像统一处理,这些数据在分辨率、光照条件和标注粒度上存在显著差异,构建过程中需要克服复杂的预处理与对齐工作。二是可解释性与临床落地的鸿沟。尽管数据集引入了ABCDE规则与VQA机制,但如何确保模型生成的解释既符合医学逻辑又能够有效辅助医生决策仍是关键障碍。此外,数据集中各类病变类别的不平衡分布,以及来自不同采集设备引入的域偏移,进一步加剧了模型泛化能力的挑战,使得算法在真实临床环境中的鲁棒性难以保证。
常用场景
经典使用场景
在皮肤影像学领域,nutriderm-dataset以多源异构数据融合的独特优势脱颖而出。该数据集汇聚了ISIC 2016至2018三个经典公开数据集的皮肤镜图像与掩膜,以及PAD-UFES-20临床影像与元数据,形成了涵盖黑色素瘤、光化性角化病等多种皮损类型的丰富样本库。其经典使用场景聚焦于结合图像分割与视觉问答的多模态皮肤病变分析,研究者可借此训练出既能精准描绘病灶边界,又能回答医生自然语言提问的智能模型。这样的设计范式,为皮肤科人工智能系统在诊断透明度与交互性上的突破提供了宝贵的实验基准。
实际应用
在实际临床场景中,nutriderm-dataset驱动的系统可部署于远程医疗平台与门诊辅助诊断工具。医生上传皮损图像后,模型自动输出病灶分割区域并回答诸如“该病变是否满足ABCDE规则中的不对称标准”类的精确询问。该数据集提供的多模态能力,使智能系统不仅能识别病灶性质,还能通过自然语言与医生交互,给出可追踪的诊断推理过程。此外,该数据集因包含来自不同采集设备的源图像,支持在分级诊疗体系下构建通用性更强的辅助决策系统,提升基层医院对恶性皮肤病变早期排查的效率与准确率。
衍生相关工作
nutriderm-dataset的诞生衍生了一系列皮肤科多模态人工智能领域的前沿工作。围绕其包含的VQA与MARIA数据子集,研究者开展了基于视觉语言预训练模型的皮肤病理理解研究,探索将CLIP等大语言模型适配于皮肤科问答的迁移学习框架。结合其图像分割分支,一些工作尝试引入基于注意力机制的边缘感知网络,在ISIC基准任务上实现了更精细的病灶轮廓提取。同时,多模态解释性模块的发展也受到该数据集的启发,催生了结合临床元数据与ABCED规则的推理可视化模型,这些工作共同推动了数字皮肤科学从单纯分类迈向解释性协同诊疗的新阶段。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务