遇见数据集

compliments-reference-db

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

Compliments Reference DB 是一个结构化的参考数据库,基于确定性、完全可追溯的管道构建,用于处理原始 Compliments 产品数据。该数据集包含 4,440 个产品,经过6个阶段的处理:数据质量基础、语义标准化、产品领域与分类及分组、变体分配、营养集成、以及 Nutri-Score 2023 与 Agribalyse 代理评分。最终输出包括产品分组映射(3,691 个产品组)、变体分配(4,299 个变体)、营养数据(每100克营养信息、清洁营养数据、产品-营养映射)和评分结果(产品分数、Agribalyse 映射、评分排除项)。设计原则强调无LLM、单一事实源、完全可追溯(通过 external_id 跨阶段链接)、无数据丢失、食品与非食品领域分离。数据集适用于产品数据标准化、营养评分计算、变体分析、产品分组研究等任务,可用于学术或研究用途。

Compliments Reference DB is a structured reference database built on a deterministic and fully traceable pipeline for processing raw Compliments product data. This dataset contains 4,440 products that have undergone six processing stages: data quality foundation, semantic standardization, product domain, classification and grouping, variant assignment, nutrition integration, and Nutri-Score 2023 and Agribalyse proxy scoring. The final outputs include product grouping mappings (3,691 product groups), variant assignments (4,299 variants), nutrition data (nutrition information per 100 grams, clean nutrition data, product-nutrition mappings) and scoring results (product scores, Agribalyse mappings, scoring exclusions). Its design principles emphasize no LLMs, single source of truth, full traceability (cross-stage linking via external_id), no data loss, and separation of food and non-food domains. This dataset is suitable for tasks such as product data standardization, nutrition score calculation, variant analysis, product grouping research, and other tasks, and can be used for academic or research purposes.

创建时间:
2026-07-29
原始信息汇总

Compliments Reference DB 数据集详情

数据集概述

Compliments Reference DB 是一个基于 Sobeys Inc. 旗下 ComplimentsSensations 自有品牌构建的干净、可复现的产品参考数据库。该数据集通过 6 个确定性的处理阶段构建,完全不使用大语言模型(LLM),保证了全程可追溯性。

  • 语言: 英语
  • 许可证: MIT
  • 权威数据来源: saraNour/compliments-brand
  • 发布地址: saraNour/compliments-reference-db(公开)

管道概览(6 个阶段)

阶段 名称 输入数据 输出数据 关键指标
1 数据质量基础 products.parquet (4,440 × 16) phase1_output.parquet (4,440 × 14) 100% 空值列被移除
2 语义归一化 phase1_output (4,440 × 14) phase2_output.parquet (4,440 × 34) 新增 20 列
3 产品领域 + 分类 + 分组 phase2_output (4,440 × 34) reference_product_catalog.csv (3,691 组) 19 个分类类别
4 变体分配 phase3 + phase2 映射 product_variant_mapping.parquet (4,440 × 11) 4,299 个变体
5 营养数据整合 nutrition.parquet + phase3 + phase4 nutrition_per_100g.parquet 100% 匹配率
6 Nutri-Score + Agribalyse phase5 输出 phase6_product_scores.parquet (4,440) 364 个获得评分 (8.2%)

数据来源

权威输入数据

文件 行 × 列 来源
products.parquet 4,440 × 16 saraNour/compliments-brand
nutrition.parquet 4,440 × 21 saraNour/compliments-brand

外部参考资源

  • Google 产品分类体系: 用于 GPC 映射
  • Nutri-Score 2023 算法: 基于 Eurofins 引用的 Santé Publique France FAQ(2023年12月21日版)
  • Agribalyse v3.2: CIQUAL 数据库,用于环境类别映射

关键处理细节

阶段 1 — 数据质量基础

  • 数据清理:空白归一化、空字符串转 null、品牌和标题清洗
  • UPC 验证:格式检查、重复检测、复用 UPC 分析
  • 移除 100% 空值列(size_per_unitsize_total

阶段 2 — 语义归一化

  • 品牌归一化:9 个原始品牌变体 → 2 个品牌 + 7 条产品线
  • 提取 9 个布尔身份标志:有机、无麸质、无糖、无盐、无乳糖、无花生、植物基、低钠等
  • 生成确定性身份哈希(identity_hash)

阶段 3 — 产品分类与分组

  • 食品/非食品分类: food 2,814 (63.4%)、unknown 1,232 (27.7%)、non_food 394 (8.9%)
  • 19 个分类类别: 涵盖乳制品、肉类海鲜、饮料、烘焙、冷冻、农产品、调味品、糖果、零食、意面大米、早餐、罐头、家居清洁、健康保健、个人护理、婴儿护理、宠物食品等
  • 产品分组: 3,691 个唯一分组,303 个模糊案例

阶段 4 — 变体分配

  • 基于包装规格/属性构建变体键(如 amt500.0|unitgcount20nosize
  • 生成 4,299 个唯一变体

阶段 5 — 营养数据整合

  • 归一化方法:直接 100g(150 个)、按食用份量缩放(1,351 个)、未归一化(2,939 个)
  • 营养质量状态:VALID 4,076 个、MISSING 364 个、SUSPICIOUS 0 个
  • 归一化至每 100g/mL 的营养值(17 个营养字段)

阶段 6 — Nutri-Score 2023 和 Agribalyse 映射

  • 符合评分条件的产品: 364 个(8.2%),需同时满足食品领域、营养数据有效、6 个必需字段完整
  • Nutri-Score 等级分布: A 级 31 个 (8.5%)、B 级 42 个 (11.5%)、C 级 135 个 (37.1%)、D 级 83 个 (22.8%)、E 级 73 个 (20.1%)
  • Agribalyse 映射置信度: HIGH 1,908 个、MEDIUM 885 个、LOW 1,310 个、NONE 337 个

数据文件结构

compliments-reference-db/ ├── phase1/ (源代码、输出、验证、统计) ├── phase2/ (源代码、输出、验证、统计) ├── phase3/ (参考产品目录、产品分组映射、分类映射、非食品产品表) ├── phase4/ (产品变体映射、参考产品变体表) ├── phase5/ (每100g营养数据、产品营养映射) └── phase6/ (产品评分、Agribalyse映射、评分排除表)

快速使用

python from huggingface_hub import hf_hub_download import pandas as pd

加载任意阶段输出

path = hf_hub_download("saraNour/compliments-reference-db", "phase6/outputs/phase6_product_scores.parquet", repo_type="dataset") df = pd.read_parquet(path)

主要输出表

  • reference_product_catalog.csv: 3,691 个参考产品组
  • product_group_mapping.csv: 4,440 个产品到组的映射
  • product_variant_mapping.parquet: 4,440 个产品到变体的映射
  • reference_product_variants.parquet: 4,299 个唯一变体
  • nutrition_per_100g.parquet: 4,440 个产品的每 100g 营养数据
  • phase6_product_scores.parquet: 4,440 个产品的 Nutri-Score 评分
  • phase6_agribalyse_mapping.parquet: 4,440 个产品的 Agribalyse 类别映射
搜集汇总
数据集介绍
compliments-reference-db 数据集图片
构建方式
该数据集以Sobeys Inc.旗下Compliments和Sensations自有品牌为对象,依托saraNour/compliments-brand权威数据源,构建了一条包含六个确定性阶段、无大语言模型介入的可复现流水线。各阶段依次执行数据质量清洗、语义规范化、产品领域与分类学映射、变体分配、营养数据整合及Nutri-Score与Agribalyse评分,全程保留审计轨迹与验证记录,确保从原始产品信息到参考数据库的每一步转化均有据可查。
使用方法
使用者可通过HuggingFace Hub直接下载各阶段输出文件,如phase6_product_scores.parquet,并结合pandas等工具进行数据读取与分析。该数据库适用于食品营养评估、产品归类研究及零售供应链分析等场景,便于进行产品比较、营养评分复算或作为下游机器学习任务的特征基础。
背景与挑战
背景概述
compliments-reference-db 数据集由 Sara Nour 等人于 2023 年构建,旨在为加拿大 Sobeys 公司的自有品牌 Compliments 和 Sensations 提供高质量、可复现的产品参考数据库。该数据集基于来自 HuggingFace 的单一权威数据源,通过六个确定性的处理阶段,完成了数据清洗、语义标准化、产品分类、变体分配、营养数据整合及 Nutri-Score 评分等任务。其核心研究问题在于构建一个无需大语言模型、完全可追溯的产品数据库,以支持食品营养分析和环境足迹评估。该数据集为零售业自有品牌产品研究提供了标准化基准,对食品信息学、消费者健康监测及可持续食品系统研究具有重要影响。
当前挑战
该数据集面临的挑战涵盖多个层面。在领域层面,食品产品数据库的构建需应对数据异构性、品牌命名不统一、产品分类复杂等核心难题,如数据集中 4,440 个产品的品牌名称经过规范化合并为两个主品牌,并识别出 19 个分类类别,但仍有 27.7% 的产品被归类为未知领域。在构建过程中,主要挑战包括:营养数据的标准化和匹配,其中 2,939 个产品因份量单位模糊而无法归一化至每 100g 值;Nutri-Score 评分方法要求六项必需字段齐全,导致仅 8.2% 的产品满足评分条件;此外,产品分组中检测到 303 个因核心标题、风味或配方差异导致的分组歧义。这些挑战凸显了在零售数据集中实现高完整性、高一致性及可复现性的技术难点。
常用场景
经典使用场景
compliments-reference-db数据集是食品杂货领域产品参考数据库的典范之作,其核心价值在于提供了一套严谨的多阶段数据处理流水线,涵盖数据质量清洗、语义规范化、产品归类、变体分配、营养信息整合以及健康评分计算。该数据集适用于零售业产品信息管理系统构建、食品营养分析模型训练以及消费者健康决策支持等研究场景,尤其在探索私有品牌产品结构、营养标签合规性以及食品环境足迹评估方面展现了独特优势。
解决学术问题
该数据集解决了食品科学和信息管理交叉领域中的多项核心学术问题,包括产品数据异构性整合、营养信息标准化、以及健康评分体系的可复现计算。通过提供统一的产品目录、变体映射和营养数据归一化结果,它有效突破了传统零售数据中品牌命名混乱、规格不一致和营养信息缺失等瓶颈,为大规模食品数据库的构建和维护提供了方法论参考,推动了营养流行病学中基于产品级数据的精准评估研究。
实际应用
在实际应用层面,compliments-reference-db可用于零售商优化产品组合、监管机构审查营养标签合规性、消费者健康应用开发,以及食品行业碳排放核算。其Nutri-Score 2023评分和Agribalyse环境映射功能,使得该数据集成为辅助消费者做出健康且可持续食品选择的工具,同时为食品企业制定产品改进策略提供数据支撑,具有显著的商业和社会价值。
数据集最近研究
最新研究方向
该数据集聚焦于加拿大零售巨头Sobeys旗下自有品牌Compliments与Sensations的食品与非食品产品,通过六阶段确定性数据流水线构建了高可复现性的参考数据库。当前最前沿的研究方向在于整合2023年更新的Nutri-Score算法与Agribalyse环境足迹映射,为产品健康属性与生态影响提供双重评分,旨在回应全球消费者对食品营养透明化与可持续性日益增长的关切。其严谨的语义归一化、变体解析与营养数据匹配流程,为自有品牌产品横向比较、膳食干预研究及环境膳食生命周期评估提供了高质量基准数据源,尤其推动了零售私有标签在公共健康与气候行动中的数据驱动决策支持。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务