nutriderm-dataset
收藏资源简介:
NutriDermAI数据集是一个开源皮肤病学数据集,旨在支持名为NutriDermAI的多模态人工智能系统。该系统结合ABCDE(不对称性、边界、颜色、直径、演变)可解释性框架与视觉问答(VQA)能力,以辅助皮肤病分析。该数据集是VJTI孟买2026年一项M.Tech学位论文的组成部分。数据来源包括:ISIC 2016、ISIC 2017和ISIC 2018的皮肤镜图像及其对应的分割掩码;PAD-UFES-20的临床图像及相关元数据;以parquet格式存储的视觉问答(VQA)数据,分为训练集、验证集和测试集;以及标记为MARIA的parquet文件。数据集整体规模在10万到100万样本之间,适用于图像分割和视觉问答等机器学习任务,主要聚焦于皮肤病变(如黑色素瘤)的分析与诊断。
NutriDermAI dataset is an open-source dermatology dataset designed to support the multimodal artificial intelligence system named NutriDermAI. This system integrates the ABCDE (Asymmetry, Border, Color, Diameter, Evolving) interpretability framework and visual question answering (VQA) capabilities to assist dermatological analysis. This dataset is a component of an M.Tech thesis from VJTI Mumbai in 2026. Its data sources include: dermoscopic images and their corresponding segmentation masks from ISIC 2016, ISIC 2017 and ISIC 2018; clinical images and associated metadata from PAD-UFES-20; visual question answering (VQA) data stored in Parquet format, split into training, validation and test sets; and Parquet files labeled MARIA. The overall scale of the dataset ranges from 100,000 to 1,000,000 samples. It is applicable to machine learning tasks such as image segmentation and visual question answering, and mainly focuses on the analysis and diagnosis of skin lesions (e.g., melanoma).
数据集概述:NutriDermAI
数据集名称:NutriDermAI Dataset
许可证:CC-BY-4.0
任务类别:图像分割(image-segmentation)、视觉问答(visual-question-answering)
标签:皮肤科(dermatology)、皮肤病变(skin-lesion)、ABCDE、黑色素瘤(melanoma)、多模态(multimodal)
数据规模:100,000 至 1,000,000 条样本
数据集背景
该数据集是为 NutriDermAI 项目构建的,旨在开发一个面向皮肤科的多模态AI系统,支持ABCDE可解释性以及视觉问答(VQA)。该项目为VJTI Mumbai 2026年的硕士论文研究,由 Prof. Manasi Kulkarni 指导。
数据集内容
数据集包含以下子文件夹,覆盖多个来源的皮肤影像与标注数据:
| 文件夹 | 内容 |
|---|---|
ISIC2016/ |
ISIC 2016 皮肤镜图像 + 掩膜 |
ISIC2017/ |
ISIC 2017 皮肤镜图像 + 掩膜 |
ISIC2018/ |
ISIC 2018 皮肤镜图像 + 掩膜 |
PAD-UFES-20/ |
PAD-UFES-20 临床图像 + 元数据 |
Stage7/ |
VQA 的 Parquet 文件(训练/验证/测试集) |
it_fusion_modular_project/ |
MARIA 的 Parquet 文件 |
使用方式
通过 Hugging Face datasets 库加载数据集(以训练集为例):
python from datasets import load_dataset ds = load_dataset("akhil06/nutriderm-dataset", split="train")




