遇见数据集

openfoodfacts/nutrient-detection-layout

收藏
Hugging Face2024-12-23 更新2024-06-12 收录
官方服务:

资源简介:

该数据集主要包含与食品营养成分相关的信息,如碳水化合物、脂肪、能量等。数据集的特征包括ner_tags、tokens、bboxes、image和meta等。ner_tags特征包含了一系列与食品营养成分相关的标签,tokens特征是一个字符串序列,bboxes特征是一个整数序列的序列,image特征是一个图像类型,meta特征是一个结构体,包含条形码、图像ID、图像URL、OCR URL、批次、标签工作室ID、检查状态、USDA表格、营养文本、无营养表格和评论等信息。数据集分为训练集和测试集,训练集包含1690个样本,测试集包含180个样本。

This dataset primarily contains information related to food nutritional components, such as carbohydrates, fats, energy, etc. The features of the dataset include ner_tags, tokens, bboxes, image, and meta. The ner_tags feature contains a series of labels related to food nutritional components, the tokens feature is a sequence of strings, the bboxes feature is a sequence of sequences of integers, the image feature is of image type, and the meta feature is a structure containing barcode, image ID, image URL, OCR URL, batch, label studio ID, checked status, USDA table, nutrition text, no nutrition table, and comments. The dataset is divided into a training set and a test set, with the training set containing 1690 samples and the test set containing 180 samples.

提供机构:
openfoodfacts
原始信息汇总

数据集概述

数据集特征

  • meta

    • barcode: 字符串
    • image_id: 字符串
    • image_url: 字符串
    • ocr_url: 字符串
    • batch: 字符串
    • label_studio_id: 整数
    • checked: 布尔值
    • usda_table: 布尔值
    • nutrition_text: 布尔值
    • no_nutrition_table: 布尔值
    • comment: 字符串
  • tokens: 字符串序列

  • bboxes

    • 序列: 整数序列
  • ner_tags

    • 类标签:
      • 0: O
      • 1: B-FIBER_100G
      • 2: I-FIBER_100G
      • 3: B-CHOLESTEROL_100G
      • 4: I-CHOLESTEROL_100G
      • 5: B-CHOLESTEROL_SERVING
      • 6: I-CHOLESTEROL_SERVING
      • 7: B-SATURATED_FAT_100G
      • 8: I-SATURATED_FAT_100G
      • 9: B-SUGARS_100G
      • 10: I-SUGARS_100G
      • 11: B-IRON_100G
      • 12: I-IRON_100G
      • 13: B-VITAMIN_D_100G
      • 14: I-VITAMIN_D_100G
      • 15: B-SALT_100G
      • 16: I-SALT_100G
      • 17: B-TRANS_FAT_100G
      • 18: I-TRANS_FAT_100G
      • 19: B-VITAMIN_D_SERVING
      • 20: I-VITAMIN_D_SERVING
      • 21: B-FAT_100G
      • 22: I-FAT_100G
      • 23: B-CARBOHYDRATES_100G
      • 24: I-CARBOHYDRATES_100G
      • 25: B-ADDED_SUGARS_SERVING
      • 26: I-ADDED_SUGARS_SERVING
      • 27: B-ENERGY_KCAL_SERVING
      • 28: I-ENERGY_KCAL_SERVING
      • 29: B-CALCIUM_SERVING
      • 30: I-CALCIUM_SERVING
      • 31: B-SERVING_SIZE
      • 32: I-SERVING_SIZE
      • 33: B-PROTEINS_SERVING
      • 34: I-PROTEINS_SERVING
      • 35: B-ENERGY_KCAL_100G
      • 36: I-ENERGY_KCAL_100G
      • 37: B-SODIUM_100G
      • 38: I-SODIUM_100G
      • 39: B-CARBOHYDRATES_SERVING
      • 40: I-CARBOHYDRATES_SERVING
      • 41: B-ENERGY_KJ_SERVING
      • 42: I-ENERGY_KJ_SERVING
      • 43: B-SODIUM_SERVING
      • 44: I-SODIUM_SERVING
      • 45: B-SALT_SERVING
      • 46: I-SALT_SERVING
      • 47: B-SUGARS_SERVING
      • 48: I-SUGARS_SERVING
      • 49: B-PROTEINS_100G
      • 50: I-PROTEINS_100G
      • 51: B-FIBER_SERVING
      • 52: I-FIBER_SERVING
      • 53: B-ENERGY_KJ_100G
      • 54: I-ENERGY_KJ_100G
      • 55: B-CALCIUM_100G
      • 56: I-CALCIUM_100G
      • 57: B-POTASSIUM_100G
      • 58: I-POTASSIUM_100G
      • 59: B-IRON_SERVING
      • 60: I-IRON_SERVING
      • 61: B-FAT_SERVING
      • 62: I-FAT_SERVING
      • 63: B-POTASSIUM_SERVING
      • 64: I-POTASSIUM_SERVING
      • 65: B-SATURATED_FAT_SERVING
      • 66: I-SATURATED_FAT_SERVING
      • 67: B-TRANS_FAT_SERVING
      • 68: I-TRANS_FAT_SERVING
      • 69: B-ADDED_SUGARS_100G
      • 70: I-ADDED_SUGARS_100G
  • image: 图像

数据集分割

  • train

    • num_bytes: 213450873.0
    • num_examples: 732
  • test

    • num_bytes: 21422030.0
    • num_examples: 80

数据集大小

  • download_size: 230515614
  • dataset_size: 234872903.0

配置

  • config_name: default
  • data_files
    • train: data/train-*
    • test: data/test-*
搜集汇总
数据集介绍
openfoodfacts/nutrient-detection-layout 数据集图片
构建方式
该数据集源于Open Food Facts数据库中采集的营养标签图像,由专业标注团队采用BIO标注方案进行精细标注。在构建过程中,仅对营养表格中的数值(含单位)进行标注,而非营养素名称本身。每个标注样本包含通过Google Cloud Vision API提取的文本令牌、对应的边界框坐标(归一化至1至1000区间)以及原始图像。数据集共计约3000个样本,其中训练集包含2884个样本,测试集包含199个样本,旨在支持基于LayoutLM类模型的令牌分类任务。
使用方法
使用该数据集时,可借助Hugging Face的datasets库直接加载,自动获取标签ID与标签名称的映射关系。数据预处理阶段需先对输入图像执行OCR以提取文本令牌和边界框,随后将令牌序列、边界框序列及对应的NER标签输入LayoutLM类模型进行训练。该数据集专为令牌分类任务设计,模型需为每个令牌分配一个特定的营养标签,从而实现从营养表格中自动提取结构化营养信息的目标。
背景与挑战
背景概述
在食品科学与公共健康领域,准确提取包装食品的营养成分信息对膳食评估、慢性病防控及营养标签合规性审查至关重要。Open Food Facts作为一个开源食品数据库,联合Nutrisight项目团队于近期构建了该命名实体识别数据集,旨在从商品包装图像中自动解析营养成分表。该数据集由专业标注团队对约3000张来自全球食品的图像进行精细标注,采用BIO标注体系覆盖能量、脂肪、糖类等30余种营养指标的每100克与每份含量,为文档理解模型(如LayoutLM)提供了标准化的训练与测试基准。其发布填补了食品标签结构化信息抽取领域的资源空白,推动了计算机视觉与自然语言处理技术在食品安全监管与消费者知情决策中的交叉应用。
当前挑战
当前数据集面临的核心挑战集中于多源异构性带来的领域适应难题。营养成分表的版式因国家法规、产品类型及包装设计差异显著,导致表格的物理布局、字段排列顺序及单位表达方式高度多变,传统OCR与视觉语言模型难以泛化至未见过的排版风格。标注过程中,部分图像存在模糊、反光或遮挡,使得边界框定位与语义标签对齐的精度受限;此外,数据集规模仅数千张,对于包含35类细粒度营养标签的序列标注任务而言,样本量仍显不足,容易引发长尾标签(如维生素D、胆固醇)的稀疏学习问题。构建环节中,跨语言术语(如“能量”与“Energy”)的归一化处理以及多轮人工校验的成本控制,也构成实际部署时的潜在瓶颈。
常用场景
经典使用场景
在食品信息数字化与营养标签解析领域,该数据集为基于视觉与文本联合建模的命名实体识别任务提供了关键支撑。其经典使用场景聚焦于利用LayoutLM等文档理解模型,对食品包装图像中的营养成分表进行细粒度信息抽取。数据集中每个图像均经过专业标注,以BIO标记体系对每100克或每份的营养素数值(如能量、脂肪、糖分等)进行精确标记,并附带OCR生成的词元序列及其边界框坐标,这使得模型能够同时学习文本语义与空间布局特征,从而精准定位并提取营养表中的关键数值信息。
解决学术问题
该数据集有效解决了食品营养标签自动解析中因表格结构多样、文字密集、单位混杂而导致的实体边界模糊与语义歧义等学术难题。传统OCR后处理规则难以应对布局多变的营养表,而该数据集通过提供带空间位置标注的序列数据,推动了从纯文本理解向多模态文档推理的范式演进。其意义在于为营养学与计算机视觉交叉领域建立了一个可复现的基准,使研究者能够量化评估不同模型在营养信息抽取上的性能,并促进了针对小样本、长尾营养素类别(如维生素D、反式脂肪)的鲁棒识别算法的发展。
实际应用
在实际应用中,该数据集驱动的模型可集成至移动端食品分析应用或开源数据库(如Open Food Facts),实现用户拍摄食品包装后即时获取其营养成分。这对于饮食健康管理、过敏原筛查及慢性病患者的膳食监控具有直接价值。例如,消费者可通过扫描条形码自动录入能量摄入与钠含量,营养师则能批量分析货架商品的营养素构成。此外,该技术还可辅助食品监管部门自动化审核标签合规性,降低人工校验成本,并推动跨语言、跨地区营养标签标准的统一化比对。
数据集最近研究
最新研究方向
在食品营养信息自动化提取的前沿领域,openfoodfacts/nutrient-detection-layout数据集正推动着基于视觉与文本联合建模的命名实体识别技术发展。该数据集聚焦于营养标签中复杂表格结构的解析,涵盖能量、脂肪、糖类、维生素等数十种营养指标的每100克与每份含量标注,采用BIO标注方案精准定位数值与单位。其研究热点集中于利用LayoutLM等预训练模型,结合OCR生成的文本令牌与边界框坐标,实现从非结构化营养图像到结构化数据的端到端映射。这一方向与全球食品透明化运动及欧盟、FDA等机构对营养标签数字化的监管要求紧密相连,为大规模食品数据库的自动构建、饮食健康监测系统的智能化升级以及消费者端营养信息即时获取提供了关键数据支撑,显著提升了食品科学领域数据处理的精度与效率。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务