遇见数据集

thebeautyapi/beautyproducts

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“The Beauty API: 180k+ Skincare & Cosmetics Products Dataset (Sample)”,是一个专注于美容科技和市场研究的结构化样本数据集。它包含超过180,000个独特的护肤和化妆品产品记录,覆盖全球20,000多个品牌(如Paulas Choice、CeraVe、The Ordinary等)。数据集提供18GB的高分辨率产品图像(标准化白色背景),并以CSV和JSONL格式交付。核心功能包括:1) 成分智能与安全分析:每个产品都有完整的INCI成分分解、常见别名和功能分类(如抗氧化、舒缓),并提供研究支持的致痘性评分(0-5)和刺激性评分(0-5)在成分级别,以及专家安全分类(如超级明星、好东西等),支持无酒精、无香料、无精油等高级标签过滤。2) 机器学习与计算机视觉应用:作为预标记训练集,可用于品牌分析(训练多模态模型解码包装设计与成分质量之间的关联)、视觉搜索(构建“点即知”相机功能,绕过条形码需求)和零售审计(实时识别180,000+ SKU)。3) 电子商务增强:元数据旨在提升独立电商和零售的转化率并降低退货率,包括页面丰富(生成SEO友好的产品描述和成分词汇表)和信任信号(实施安全徽章和个性化肤质匹配引擎)。技术架构包括稳定产品ID、品牌、名称、描述、图像文件名、标签、简单成分列表和丰富成分对象等字段。数据集适用于非商业研究,商业用途需额外许可。

The dataset is titled The Beauty API: 180k+ Skincare & Cosmetics Products Dataset (Sample), a structured sample dataset focused on beauty-tech and market research. It contains over 180,000 unique skincare and cosmetics product records, covering more than 20,000 global brands (e.g., Paulas Choice, CeraVe, The Ordinary). The dataset provides 18GB of high-resolution product images (standardized white backgrounds) and is delivered in CSV and JSONL formats. Key capabilities include: 1) Ingredients Intelligence & Safety: Each product is parsed with full INCI breakdowns, common aliases, and functional classifications (e.g., antioxidant, soothing), along with research-backed comedogenic ratings (0–5) and irritancy scores (0–5) at the ingredient level, expert safety classifications (e.g., Superstars, Goodies), and advanced tagging for filtering alcohol-free, fragrance-free, and essential oil-free formulations. 2) Machine Learning & Computer Vision: It serves as a pre-labeled training set for branding analysis (training multimodal models to decode correlations between packaging design and ingredient quality), visual search (building Point-and-Know camera features that bypass barcodes), and retail auditing (powering automated shelf-scanners to identify 180,000+ SKUs in real-world conditions). 3) E-commerce Enrichment: Metadata is designed to boost conversion and lower return rates for indie e-commerce and retail, including page enrichment (generating SEO-rich product descriptions and ingredient glossaries) and trust signals (implementing safety badges and personalized skin-type matching engines). The technical schema includes fields such as stable product ID, brand, name, description, image filename, tags, simple ingredients list, and rich ingredient objects. It is licensed for non-commercial research, with commercial use requiring additional licensing.

提供机构:
thebeautyapi
搜集汇总
数据集介绍
thebeautyapi/beautyproducts 数据集图片
构建方式
该数据集由The Beauty API团队构建,依托研究驱动的标准化体系,收录了超过18万款美容产品的结构化信息。构建过程摒弃了常见的粗糙爬取方式,而是对每款产品进行了精细的规范化处理。数据涵盖品牌、名称、类别、产地等基础字段,并特别对成分列表进行了深度解析,保留了标签上的原始顺序。每个成分均关联了CAS、EC、IUPAC等化学标识符,并附有基于研究的致痘性、刺激性评分以及编辑专家评级。此外,数据集中还包含了18GB的高分辨率产品图像,图像以产品ID命名,便于直接映射和集成。
特点
本数据集的核心亮点在于其成分智能与安全性分析能力。每款产品的成分列表被转化为丰富的结构化对象,包含功能角色与常见别名。数据集提供了多个布尔型“不含”标志(如是否含香精、干燥酒精、对羟基苯甲酸酯等),支持快速过滤。同时,该数据集兼具机器学习和计算机视觉应用潜力,其高分辨率图像档案可用于品牌分析、视觉搜索和零售审计。数据集支持CSV和JSONL两种可互换格式,适用于推荐系统、电商页面丰富及AI模型训练等多种场景。
使用方法
数据集以CSV或JSONL格式交付,用户可根据需求选择使用。产品ID与图像文件名一一对应,便于多模态任务中的数据对齐。对于成分分析,可直接解析JSONL中的嵌套字段或提取CSV中的JSON编码字符串,获取每个成分的化学标识符和安全性评分。利用布尔型“不含”标志,可快速筛选出符合特定标准的产品子集。本样本数据集采用CC BY-NC 4.0许可,适用于非商业研究和评估。商业用途需通过The Beauty API官网获取完整数据集与商业许可证。
背景与挑战
背景概述
该数据集创建于2026年6月,由The Beauty API团队构建,汇集了超过18万种美妆与护肤产品的结构化信息,涵盖2万个全球品牌及18GB的高分辨率图像档案。其核心研究问题在于为美容科技与市场研究提供一个经过标准化、可即刻用于推荐系统、电子商务前端及AI模型的数据库,突破传统数据采集杂乱无章的瓶颈。该数据集对化妆品成分分析、计算机视觉、零售自动化等领域产生了重要影响,尤其为多模态模型训练和成分安全性研究提供了高质量基础。
当前挑战
数据集面临的挑战包括:首先,美妆产品配方持续更新,品牌与产品数量快速膨胀,如何保持数据集的时效性与全面性成为关键难题;其次,构建过程中需对产品图像进行统一的标准化处理(如白背景、ID映射),同时从复杂标签中解析出INCI成分列表、化学标识符及安全性评分,数据清洗与标注工作复杂度极高;此外,针对不同地域的品牌名称、语言变体及产品分类差异,保持数据的一致性与互操作性亦构成显著障碍。
常用场景
经典使用场景
在美容科技与计算化妆品学这一新兴交叉领域中,beautyproducts数据集凭借其结构化的成分解析与视觉档案,成为训练多模态模型以理解产品成分-包装关联的基石。研究者常利用其18GB的高分辨率图像与完备的成分标签,构建跨模态检索系统,实现基于照片的产品识别与成分分析。该数据集还常用于化妆品成分安全性的预测建模,通过整合致痘性、刺激性等专家评分,训练分类模型以自动化评估产品配方风险。此外,其丰富的品牌产地与分类标签为细粒度产品推荐系统的研发提供了标准化的基准测试平台。
解决学术问题
该数据集直面化妆品领域长期存在的学术瓶颈——非结构化、碎片化的产品信息难以支撑系统性研究。传统美容数据集多为网络爬取的低质量文本,缺乏标准化的成分标识与化学编码。beautyproducts通过提供包含CAS、EC、IUPAC等监管级化学标识符的INCI配方全解析,解决了配方相似性量化分析、成分功能图谱构建等基础问题。其权威的皮肤学安全评分使得研究者能够大规模验证成分-不良反应的统计关联,推动了计算毒理学在化妆品领域的实证研究,为建立更科学的产品安全评估体系奠定了数据基础。
衍生相关工作
该数据集催生了一系列旨在提升化妆品产品理解与推荐精度的经典工作。基于其成分结构,研究者开发了“成分功能嵌入”方法,学习功能角色向量的连续表示以预测配方功效。其视觉与文本双模态特性使得“包装-价格-感知质量”关联模型的训练成为可能,揭示了设计美学与内在品质之间的统计分析范式。在推荐系统领域,衍生工作利用产品级布尔安全标志与肤质标签,构建了可解释的个性化推荐框架,实现了成分敏感用户的产品过滤。此外,其丰富的化学标识符信息被用于构建“成分替代物推荐引擎”,辅助配方师在保持功效前提下替换风险成分,推动了绿色化学在美容产业中的实践应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务