遇见数据集

Skincare Ingredients Dataset

收藏
github2026-06-30 更新2026-07-15 收录
官方服务:

资源简介:

一个免费、开源的护肤成分数据库,包含128种化妆品成分,涵盖INCI名称、益处、皮肤类型、致痘评级、孕期安全性等20多个字段,并提供JSON、CSV和迷你JSON格式,以及一个机器可读的可混合性兼容性引擎,适用于构建护肤应用、AI日常规划器和推荐系统。

A free, open-source skincare ingredient database containing 128 cosmetic ingredients. It covers over 20 fields including INCI names, benefits, skin types, comedogenicity ratings, pregnancy safety information and more. Additionally, it provides JSON, CSV and mini-JSON formats, as well as a machine-readable mixability compatibility engine, which is suitable for developing skincare applications, AI daily planners and recommendation systems.

创建时间:
2026-06-30
原始信息汇总

数据集概要

本数据集是一个面向开发者的开源、结构化护肤品成分数据库,包含 128 种化妆品成分,并提供成分兼容性引擎。

核心内容

数据规模与覆盖率

  • 128 种成分:涵盖活性物、酸类、保湿剂、油脂、神经酰胺、多肽、防晒剂、防腐剂、表面活性剂等。
  • 28 个功能类别:每个类别有对应的纯文本定义(categories.json)。
  • 21 条成对混合规则:覆盖 15 个成分组,给出 avoid / caution / great / essential 四种严重等级及使用建议。

数据格式

  • 支持格式:JSON(精简与美观格式)、CSV、按类别分列的 JSON 文件。
  • 无依赖工具:提供 Python 脚本用于构建、验证、搜索及混合规则检查。

数据模式

每条成分记录包含 20+ 字段,结构一致(通过 schema/ingredient.schema.json 验证):

字段 类型 说明
id 字符串 唯一标识(短横线命名)
inci_name 字符串 国际化妆品原料命名(INCI)标准名称
common_name 字符串 友好显示名称
also_known_as 字符串数组 同义词及商品名
category 字符串数组 功能分类(见 categories.json
description 字符串 一句话描述
benefits 字符串数组 对皮肤的功效
skin_types 字符串数组 适用肤质:all / dry / oily / combination / sensitive / acne-prone / mature / normal
concerns 字符串数组 注意事项/慎用人群
comedogenic_rating 整数/null 致痘等级:0(不致痘)至5(高度致痘)
irritancy 枚举 刺激性:low / medium / high
pregnancy_safe 枚举 孕期安全性:safe / caution / avoid
vegan 枚举 是否纯素:yes / no / varies
origin 枚举 来源:natural / synthetic / both
typical_concentration 字符串 常用浓度范围
ph_range 字符串/null 最佳pH范围
time_of_use 枚举 使用时段:AM / PM / AM/PM
evidence_level 枚举 证据等级:strong / moderate / limited
pairs_well_with 字符串数组 可搭配使用的成分
avoid_with 字符串数组 应谨慎混合的成分

成分兼容性引擎

  • 规则定义于 data/compatibility_rules.json
  • 规则基于成分组(如类视黄醇、AHA、维生素C、多肽、防晒剂)之间的配对,一条规则可覆盖组内所有成分。
  • 严重等级:avoid(不要混合)、caution(谨慎使用/交替使用)、great(推荐组合)、good(效果良好)、essential(一方必须搭配另一方,如酸类必须搭配日间防晒)。
  • 每条规则包含原因与使用建议。
  • 可通过命令行工具进行混合检查:python3 scripts/search.py --check retinol "vitamin c"

数据统计

(来源:data/stats.json,自动生成)

  • 128 种成分,分属 28 个功能类别
  • 孕期安全性:104 种安全、18 种需谨慎、6 种避免
  • 纯素:112 种
  • 不致痘(致痘等级 0):98 种
  • 证据等级:39 种强证据、68 种中等证据、21 种有限证据

使用方式

  • JavaScript/TypeScript:直接导入 data/ingredients.json
  • Python:使用 json.load() 加载 data/ingredients.json
  • 远程加载:通过 GitHub 原始 URL 获取
  • 命令行工具(纯 Python,无依赖):
    • python3 scripts/build.py:重新生成 JSON/CSV/按类别文件/统计/演示
    • python3 scripts/validate.py:模式与完整性检查
    • python3 scripts/search.py:搜索成分、按肤质/孕期安全性过滤、执行混合检查
  • 示例代码:提供 React 组件、Node.js 示例、Python 示例

仓库结构

skincare-ingredients-dataset/ ├── data/ # 数据集文件(自动生成) │ ├── ingredients.json # 完整数据集(美观格式) │ ├── ingredients.min.json # 精简格式 │ ├── ingredients.csv # 电子表格格式 │ ├── compatibility_rules.json # 混合引擎 │ ├── categories.json # 类别词汇表 │ ├── stats.json # 统计数据 │ └── by-category/ # 按类别分列的 JSON 文件 ├── schema/ # JSON 模式定义 ├── scripts/ # 工具脚本(数据源编辑于此) ├── examples/ # 使用示例 ├── demo/ # 交互式演示(单文件 HTML) ├── assets/ # 截图与社交媒体图片 └── docs/ # 文档

目标用户

  • 护肤品/美容应用程序开发
  • AI/大语言模型产品(提供结构化事实)
  • 成分分析工具
  • 护肤流程检查工具
  • 数据科学与化妆品科学学习

注意事项

  • 数据集采用 MIT 许可证,可免费用于商业和个人项目。
  • 数据为教育与开发资源,不构成医疗建议。
  • 致痘等级与孕期安全性标识基于化妆品科学共识,个体耐受度有差异,配方与pH值也会影响成分表现。
搜集汇总
数据集介绍
Skincare Ingredients Dataset 数据集图片
构建方式
在皮肤护理与美容科学领域,精准的成分数据是构建智能推荐系统与功效分析工具的基础。该数据集通过系统化梳理化妆品行业标准,精选128种核心护肤成分,构建了涵盖INCI名称、功效描述、适用肤质、致痘性评级、孕期安全性等20余个字段的结构化记录。数据以JSON、CSV及压缩JSON格式发布,并创新性地整合了一套机器可读的成分配伍规则引擎,定义了15个成分组别间的21条配对规则,为开发者提供了即开即用的高质量数据资产。
特点
该数据集最显著的特点在于其兼具广度与深度的结构化设计。所有成分均附有基于化妆品科学共识的致痘性评级(0-5级)、刺激性等级及孕期安全标志,并明确定义了成分间的配伍关系(避免、警告、优秀、必需),彻底解决了传统化学标识数据集对非专业开发者不友好的痛点。此外,数据集的证据标签(强/中/有限)机制、典型浓度与pH范围等技术细节,进一步增强了其在AI护肤助手与配方分析场景中的实用价值。
使用方法
数据集的使用极为便捷,支持多种主流开发语言直接加载。JavaScript项目可通过npm或直接导入JSON文件快速集成,Python用户则可用标准json库解析数据,按肤质、孕期安全等条件进行高效过滤。配套提供的命令行工具支持成分搜索、皮肤类型筛选及配伍检查,而开箱即用的单页HTML演示程序无需后端即可运行于GitHub Pages。数据维护者仅需编辑单一Python源文件并执行构建脚本,即可同步更新所有格式的数据文件,极大降低了持续迭代的门槛。
背景与挑战
背景概述
在数字化护肤应用与智能化推荐系统蓬勃发展的当下,结构化、语义化的美容成分数据库却长期缺位。现有的化妆品化学标识体系如INCI、CAS等,虽为专业人士所依赖,却难以被消费级应用直接利用;而商业数据库则受困于高昂的许可费用与封闭的访问限制。在此背景下,Skincare Ingredients Dataset于近期由社区开发者创建,旨在填补这一空白。该数据集精心收录了128种常见护肤成分,涵盖活性物、酸类、保湿剂、油脂、防晒滤光剂等28个功能类别,为每位成分提供了详尽的字段描述。其核心贡献在于构建了一套机器可读的成分配伍规则引擎,可判定成分间的协同或冲突关系,为生成智能化护肤建议提供了结构化知识底座。该数据集以MIT开源协议发布,已为美容应用开发、AI护肤助手及成分分析工具等领域的基础构建注入了关键动力。
当前挑战
该数据集面临的核心挑战源于美容科学与数据工程的双重复杂性。在领域问题层面,护肤成分配伍与功效评估缺乏统一的金标准,成分间的相互作用受浓度、配方、pH值等多因素影响,现有相容性规则虽覆盖了15个成分组别的21条配对逻辑,却难以穷尽真实世界中成分组合的无限可能,且安全警示信息(如致痘性评级、孕期安全性标记)依赖广泛共识而非权威临床数据,存在个体耐受性差异与更新滞后之虞。在构建过程中,数据来源的可靠性是一大瓶颈,成分信息需从零散的研究文献、法规数据库及行业共识中萃取,手动整理与验证128种成分的20余个字段工作量浩繁,且缺乏自动化审核机制;兼容引擎的规则设计亦需调和彼此冲突的化学原理与护肤建议,避免产生误导性结论。此外,随着数据集向1000+成分扩展,如何维持数据一致性、引入跨语言别名及添加法定标识符(如CAS号)将成为可持续维护的严峻考验。
常用场景
经典使用场景
在护肤科学与计算交叉领域,该数据集为智能护肤应用的核心功能提供了结构化知识底座,尤其适用于构建成分智能检索系统与个性化护肤方案引擎。用户可通过简单代码调用,快速筛选出特定肤质适配、孕期安全或非致痘性的成分清单,亦可一键查询任意两种成分间的配伍关系。其内置的材质兼容性引擎囊括了视黄醇与维生素C分层使用等经典配伍原则,并以结构化字段输出严重等级、科学原理与使用建议,使得原本依赖专家经验的护肤搭配知识可被机器高效解析与推理。
解决学术问题
该数据集精准填补了化妆品科学领域一个长期存在的结构性空白——即缺乏一个既面向开发者又兼顾临床可读性的标准化成分知识库。此前,学术研究者在构建护肤推荐模型或成分功效关系分析时,只能依赖零散的化学标识符或收费商业数据库,严重制约了相关工作的可复现性与推广价值。该数据集通过统一字段如功效类别、证据等级、pH范围与搭配禁忌,使得成分间的属性联动与功效协同可以被量化建模,为基于大规模数据驱动的皮肤学实证研究提供了可靠的起点,极大地降低了入门门槛。
衍生相关工作
基于该数据集结构化设计的优越性,社区已衍生了多项具有影响力的相关工作。一方面,开发者利用其标准字段构建了交互式成分浏览器与配伍检查器演示页面,实现了零后端依赖的离线可用原型,为开源项目提供了可直接复用的前端组件范例。另一方面,围绕该数据集的兼容性规则引擎,涌现了针对神经酰胺与肽类共稳定性的扩展规则库,以及融合多语言倾向的肌肤建议系统。研究人员还将其作为基准数据,用于训练新型护肤成分推荐的大语言模型,通过嵌入相似度计算验证成分间功效协同的量化效果,进一步拓宽了该数据集在计算皮肤学中的学术边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务