遇见数据集

dermaglow-skin-faces

收藏
Hugging Face2026-07-22 更新2026-07-23 收录
官方服务:

资源简介:

DermaGlow是一个合成皮肤档案与护肤流程数据集,旨在解决人们因缺乏专业皮肤科建议而随意选择护肤品导致的浪费和皮肤问题。该数据集包含1100个完全由AI生成的合成面部肖像(512×512分辨率),每个样本关联一个结构化的皮肤档案和个性化的早晚护肤流程。皮肤档案涵盖皮肤类型(油性/干性/混合性/中性)、主要/次要关注问题(痤疮、泛红、色素沉着、皱纹、暗沉、脱水)、年龄组(18-25岁至60岁以上)、肤色(Fitzpatrick I-VI)、性别(平衡分布)等属性。护肤流程由小型LLM生成,包含具体步骤和活性成分,并标注了流程来源(原始LLM输出、自动规范化版本、模板回退)。数据集还包含生成透明度元数据,如图像提示词、生成尝试次数、面部检测结果。数据生成过程结合了SDXL-Turbo图像生成和Qwen2.5-1.5B-Instruct流程生成,并经过严格的EDA驱动迭代和质量控制,确保关键质量指标(如早晨流程100%包含防晒霜、英语纯净度100%、面部检测率99.9%)。该数据集适用于个性化护肤推荐系统、计算机视觉(面部属性分析)、合成数据生成、多模态机器学习等研究及教育场景,所有面部均为合成数据,非真实人物,护肤建议仅为研究用途而非医疗建议。

DermaGlow is a synthetic skin profile and skincare routine dataset developed to address the waste and skin problems caused by individuals randomly selecting skincare products without access to professional dermatological advice. This dataset includes 1100 fully AI-generated synthetic facial portraits (512×512 resolution), with each sample linked to a structured skin profile and personalized morning and evening skincare routines. The skin profiles cover attributes including skin type (oily, dry, combination, normal), primary and secondary skin concerns (acne, redness, hyperpigmentation, wrinkles, dullness, dehydration), age groups (18-25 years to over 60 years), skin tones (Fitzpatrick I-VI), and gender (balanced distribution). The skincare routines are generated by small LLMs, featuring specific steps and active ingredients, with the source of each routine annotated (original LLM output, automatically normalized version, template fallback). The dataset also contains generation transparency metadata, such as image prompts, generation attempt counts, and facial detection results. The data generation process integrates SDXL-Turbo image generation and Qwen2.5-1.5B-Instruct workflow generation, and has undergone rigorous EDA-driven iteration and quality control to ensure key quality metrics: 100% of morning routines include sunscreen, 100% English language purity, and a 99.9% facial detection rate. This dataset is applicable to research and educational scenarios including personalized skincare recommendation systems, computer vision (facial attribute analysis), synthetic data generation, and multimodal machine learning. All facial portraits are synthetic data and not of real individuals, and the skincare advice provided is for research purposes only and not intended as medical advice.

创建时间:
2026-07-09
原始信息汇总

数据集概述

DermaGlow — Synthetic Skin Profiles & Skincare Routines 是一个包含 1100 张合成面部肖像及其对应皮肤档案和个性化护肤流程的数据集,由 AI 完全生成,不包含真实人物。

数据集详情

  • 数据集大小:训练集 (train) 包含 1100 个样本,总大小为 68,630,174 字节,下载大小为 67,024,526 字节。
  • 数据列:每条记录包含以下字段:
    • id (字符串)
    • gender (字符串)
    • age_group (字符串)
    • prompt_age (整数)
    • skin_tone (字符串)
    • skin_type (字符串): 油性/干性/混合性/正常
    • main_concern (字符串): 痤疮、泛红、色素沉着、皱纹、暗沉、脱水
    • secondary_concern (字符串)
    • image_prompt (字符串)
    • routine_json (字符串)
    • routine_morning (字符串): 个性化早晨护肤流程
    • routine_evening (字符串): 个性化晚间护肤流程
    • routine_source (字符串): 流程来源 (llm_v2 / llm_v2_norm / fallback)
    • gen_attempts (整数)
    • face_found (布尔值)
    • image (图像): 512×512 的面部肖像

数据生成与质量控制

  • 图像生成:使用 stabilityai/sdxl-turbo 模型,根据档案 (年龄、性别、肤色、肤质外观、可见问题) 进行提示工程,并固定种子。
  • 护肤流程生成:使用 Qwen/Qwen2.5-1.5B-Instruct 模型,通过角色提示、少样本示例和严格的 JSON 输出契约生成,并包含验证门和重试机制。
  • 质量控制迭代:首次 EDA 发现约 83% 的早晨流程缺少防晒霜、出现中文字符、虚构成分等问题,以及约 9% 的图像无法通过人脸检测。通过验证门和归一化处理,对失败图像重新生成。

数据集质量评估 (EDA 最终结果)

检查项 结果
早晨流程包含防晒霜 100.0%
仅英文 100%
流程以洁面开始 (早晚) 100%
人脸检测通过 (YuNet) 99.9%
独特的早晨流程数量 1011/1100
问题-成分匹配度 83.7%
纯净子集 (通过所有严格检查) 1099/1100 (99.9%)

流程来源统计:454 个原始 LLM 生成,569 个自动归一化 (由流程添加 SPF/洁面步骤),77 个模板回退。

已知局限:507 个流程提到了不在策划白名单中的成分 (多为真实但少见的成分,如乳化剂鲸蜡醇,偶有处方级活性成分),1 张图像未通过人脸检测。

伦理与许可

  • 所有人脸均为合成,不包含真实人物。
  • 描绘的年龄均为 18 岁以上。
  • 数据集在 Fitzpatrick 肤色量表上平衡。
  • 护肤流程仅供研究/教育使用,不作为医疗建议。
  • 许可:研究及教育用途。
搜集汇总
数据集介绍
dermaglow-skin-faces 数据集图片
构建方式
该数据集基于生成式人工智能技术构建,包含1100张合成人脸肖像及对应的个性化护肤方案。图像由Stability AI的SDXL-Turbo模型根据详细属性(年龄、性别、Fitzpatrick肤色、肤质、皮肤问题)经提示工程生成,并设定固定随机种子以确保可复现性。护肤方案则通过Qwen2.5-1.5B-Instruct模型生成,采用角色提示、少样本示例和严格的JSON输出约束,配合验证门控与重试机制。数据集经历了探索性数据分析(EDA)驱动的迭代修复:首次发现约83%的晨间护肤方案遗漏防晒霜、出现中文字符及虚假成分等问题后,通过硬性验证门控、标准化处理及重新生成了失效图像,最终获得高质量子集。
特点
数据集独特之处在于融合了结构化皮肤档案与个性化护肤程序,每张图像对应包含肤质、主要及次要皮肤问题(如痤疮、泛红、色素沉着等)、年龄组、肤色及性别等详尽字段。护肤方案以晨间与晚间分步形式呈现,涵盖具体活性成分,且标注了来源(原始LLM输出、自动标准化或模板回退)。经过迭代修复,数据质量显著提升:晨间方案100%包含防晒霜,全部为英文,方案均以洁面开始,99.9%的图像通过人脸检测,83.7%的方案实现成分与皮肤问题的合理匹配,1099张图像通过了所有硬性质量检查。数据集还公开了已知局限性,如少量方案包含处方级成分。
使用方法
用户可通过HuggingFace Datasets库便捷加载该数据集,使用`load_dataset('havaferber/dermaglow-skin-faces', split='train')`命令直接获取训练集。数据集以JSON格式存储,支持按字段(如`image`、`skin_type`、`routine_morning`等)快速访问。基于其设计初衷,研究者可将其用于训练和评估AI护肤推荐系统、生成式模型(如文本到图像生成中的属性控制)以及多模态学习任务。图像与结构化文本的配对形式使其特别适合开发能够从人像照片中推断皮肤特征并生成个性化护肤方案的应用。数据集明确标注为研究及教育用途,严禁用于医疗建议。
背景与挑战
背景概述
DermaGlow Skin Faces数据集由Hava Ferber在数据科学期末项目中创建,发布于2025年,旨在通过AI生成合成面部肖像和个性化护肤方案,解决大众依赖猜测或网红推荐构建护肤routine的痛点。该数据集包含1100张512x512的合成人脸图像,每张关联年龄、性别、肤色、肤质、主要及次要皮肤问题(如痤疮、泛红、色素沉淀)和针对性的早晚护肤步骤。研究核心在于利用生成模型和LLM(如SDXL-Turbo和Qwen2.5-1.5B-Instruct)模拟真实皮肤档案,为个性化护肤推荐提供高质量训练数据。该数据集推动了合成数据在医学美容与个性化推荐领域的应用,平衡了Fitzpatrick肤色分布,为其在研究与教育场景中的伦理使用奠定基础。
当前挑战
该数据集面临的多重挑战涵盖领域问题与构建过程。领域层面,个性化护肤推荐长期受制于数据稀缺和隐私问题,真实用户的皮肤图像和routine难以大规模获取,导致模型泛化能力受限。构建中,初始生成面临严重质量缺陷,约83%的晨间routine缺少防晒步骤,LLM产生中文乱码和虚构成分(如'二氧化硫'),9%的图像未能通过人脸检测。为此,研究团队迭代执行硬性验证门控和归一化流水线,重新生成所有routine并更换种子重绘失败图像,实现99.9%的面部检测通过率和100%的防晒建议覆盖率,但仍存在83.7%的成分-问题匹配率和507例超出白名单的成分引用等局限性,需后续优化。
常用场景
经典使用场景
在个性化护肤与计算机视觉交叉领域,DermaGlow合成面部数据集为多模态皮肤分析提供了理想的研究基准。该数据集包含1100张512×512的合成面部肖像,每张图像均关联了结构化的皮肤档案,涵盖肤质、肤色、年龄组、性别及主要次要皮肤问题等精细标注。研究者可基于此数据集训练图像到皮肤属性的映射模型,或开发融合面部图像与元数据的多模态推荐系统,实现从视觉特征到个性化护肤方案的端到端推断。
解决学术问题
该数据集有效解决了个性化护肤领域长期存在的两大学术困境:真实患者数据的隐私获取难题,以及护肤方案评估中缺乏标准化基准的问题。通过提供经严格质量控制的合成人脸-档案配对数据,DermaGlow使得研究者能够在受控条件下探索皮肤问题识别、成分-功效关联分析、跨肤质方案泛化等核心学术问题。其99.9%的面部检测通过率与83.7%的成分-关注点对齐精度,为计算皮肤病学与数字健康领域的模型评估建立了可复现的量化标准。
衍生相关工作
该数据集衍生了多项具有启发性的研究工作,包括基于大语言模型与扩散模型的合成数据生成流水线(SDXL-Turbo+Qwen2.5),其迭代式质量验证框架(检测防晒缺失率从83%降至0%、中文字符污染清除等)为合成数据可靠性提供了方法论示范。数据集中1011/1100的唯一晨间方案分布,激励了护肤推荐系统的多样性研究;而对标注中出现的处方级活性成分(如视黄酸)的诚实标注,则引发了对合成数据安全边界的学术讨论,催生了面向消费级护肤推荐的安全成分过滤机制研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务