openfoodfacts/ingredient-detection
收藏资源简介:
该数据集用于训练多语言成分列表检测模型,旨在自动化从食品包装图像中提取成分列表。数据集生成过程包括使用Google Cloud Vision进行OCR处理,并通过ChatGPT-3.5提取成分列表。数据集经过自动和手动清理步骤,以确保数据质量。数据集分为训练集和测试集,分别包含5065和556个样本。每个样本包含原始文本、标记文本、令牌、NER标签、偏移量和元数据等信息。
This dataset is utilized for training multilingual ingredient list detection models, with the goal of automating ingredient list extraction from food packaging images. The dataset generation process involves OCR processing using Google Cloud Vision and ingredient list extraction via ChatGPT-3.5. Automatic and manual cleaning steps are applied to the dataset to ensure data quality. The dataset is split into training and test sets, which contain 5065 and 556 samples respectively. Each sample includes information such as original text, annotated text, tokens, NER tags, offsets, and metadata.
数据集概述
数据集用途
该数据集用于训练多语言成分列表检测模型,旨在自动化从食品包装图像中提取成分列表。
数据集生成
- 原始文本来源:通过Google Cloud Vision获得的OCR结果,仅包含在Open Food Facts上标记为成分图像的图片。
- 生成方法:使用ChatGPT-3.5进行成分列表提取,遵循特定提示和系统提示生成JSON格式的输出。
- 初步清洗:自动移除无效JSON、缺失字段或成分列表不是原始文本子串的响应。
- 模型训练与错误分析:在数据集上训练NER模型,通过检查模型预测错误来识别ChatGPT的标注错误,并采用半自动方法手动修正。
- 数据集版本:发布新数据集alpha版本,并在此基础上训练模型。数据集分为训练集(90%)和测试集(10%),测试集完全手动复查和修正。
- 文本分词:使用huggingface预分词器进行文本分词。
标注指南
- 所有语言的成分列表必须标注。
- 成分列表应从第一个成分开始,不包括“Ingredients:”等前缀。
- 单个成分且无前缀的列表不应标注。
- 成分列表结束处不包括额外信息,除非这些信息在括号内。
数据集结构
- 文件:包含两个JSONL文件,分别是训练集和测试集。
- 样本字段:
text:原始文本marked_text:用<b>和</b>标记成分范围的文本tokens:预分词后的标记ner_tags:每个标记的标签ID(BIO schema)offsets:成分范围的字符起始和结束偏移量meta:样本的附加元数据,包括条码、图像ID和图像URL




