遇见数据集

ean-product-dataset

收藏
Hugging Face2026-08-29 更新2026-08-30 收录
官方服务:

资源简介:

该数据集名为“EAN 产品数据集”,旨在将条形码(EAN/GTIN)映射到产品名称、描述、产品图片、零售商以及安全数据表链接,数据收集自丹麦的网店。产品文本为丹麦语。数据集包含两个子集:products配置包含产品信息,如EAN、产品名称、描述、图片SHA256、零售商、数据表链接等字段;images配置包含产品图片,以字节形式存储,字段包括图片二进制数据、格式(jpg、png、webp、avif、gif)、占位符标记等。两个子集通过ean字段连接。每个产品最多有三张图片,占位符图片会被标记。数据规模约953,913条产品记录,其中755,025条有描述,818,050条有图片URL,771,996条有已获取的图片,26,980条有数据表,48,078条被评估为化学品,905,695条被评估为非化学品,140条未评估,涉及151家商店。关键字段包括is_chemical(布尔值或null)、ean(经过校验位验证)。数据来源为2026年至今从零售商公开产品页面抓取,用于研究和帮助正确分类化学废物。

This dataset is named EAN Product Dataset and aims to map barcodes (EAN/GTIN) to product names, descriptions, product images, retailers, and safety data sheet links. The data is collected from Danish online stores. Product text is in Danish. The dataset contains two subsets: the products configuration includes product information such as EAN, product name, description, image SHA256, retailer, data sheet link, etc.; the images configuration includes product images stored as bytes, with fields including image binary data, format (jpg, png, webp, avif, gif), placeholder flag, etc. The two subsets are connected via the ean field. Each product has up to three images, and placeholder images are flagged. The dataset size is approximately 953,913 product records, of which 755,025 have descriptions, 818,050 have image URLs, 771,996 have fetched images, 26,980 have data sheets, 48,078 are evaluated as chemicals, 905,695 as non-chemicals, 140 unevaluated, covering 151 stores. Key fields include is_chemical (boolean or null) and ean (validated by check digit). The data is scraped from retailers public product pages from 2026 onwards, intended for research and building tools to help correctly classify chemical waste.

创建时间:
2026-08-17
原始信息汇总

EAN product dataset 数据集概述

基本信息

  • 数据集名称:EAN product dataset
  • 语言:丹麦语(da)、英语(en)
  • 许可证:其他(other)
  • 标签:ean、gtin、products、denmark、images
  • 来源:从丹麦网商公开产品页面抓取

数据内容

数据包含商品条码(EAN/GTIN)、产品名称、描述、产品图片、零售商信息和安全数据表链接。产品文本为丹麦语。

数据配置

数据集包含两个配置:

  • products(默认):主数据文件 data/ean_products.parquet
  • images:图片数据文件 images/*.parquet

图片处理特点

  • 图片以字节形式存储,而非URL链接,避免零售商CDN变更导致数据失效
  • 图片未经任何处理:保持原始格式和分辨率,不进行重新编码或缩小
  • format 列标识实际图片格式(jpg、png、webp、avif、gif)
  • 使用Pillow仅判断文件是否为图片及类型,格式由内容决定而非Content-Type
  • 文件名使用内容SHA256哈希,相同图片只存一份
  • 每个商品最多3张图片,通过 ean 字段关联(一个商品可对应多行)
  • AVIF格式需安装 pillow-avif-plugin 才能解码
  • placeholder: true 表示同一图片出现于至少25个不同商品,为"图片待更新"占位图标,已标记但未删除

数据统计

指标 数量
商品总数 958,461
含描述商品 758,335
含图片URL商品 822,424
含已获取图片商品 774,684
含安全数据表商品 26,985
已评估化学品 48,093
评估非化学品 906,879
未评估商品 3,489
商店数量 151

字段说明

  • is_chemical:取值为 true / false / nullnull 表示未评估(不等同于"无危害"),评估与产品名称分离进行,未评估到的商品为null
  • ean:每个EAN码均经过校验位验证,仅统计页面上明确标注为EAN/GTIN/条码的13位数字,避免将电话号码或表单占位符误判

来源与权利

  • 数据抓取时间:2026年至今
  • 记录字段:source(来源)、product_url(产品页链接)、harvested_at(抓取时间)
  • 数据集按原样发布,用于研究和构建化学品分类相关工具
  • 产品名称、描述和照片版权归各零售商和制造商所有
  • 权利方可发起讨论要求移除特定行或图片
搜集汇总
数据集介绍
ean-product-dataset 数据集图片
构建方式
该数据集以丹麦在线零售商的公开产品页面为数据源,通过系统化的网络爬取手段,收集了产品名称、描述、图像、零售商信息及安全数据表链接等多元异构数据。在数据构建过程中,每条产品的EAN码均经过校验位验证,仅采纳页面上明确标注为EAN/GTIN/条形码的编号,以确保标识的唯一性与准确性。图像数据以原始字节形式存储,保留零售商标注的原始格式与分辨率,并依据文件内容的SHA256哈希值去重,有效降低了存储冗余。此外,数据集融合了基于产品名称的化学物质评估结果,通过独立步骤生成二元分类标签,未评估项以空值标记,确保标注过程的严谨性。
使用方法
该数据集通过HuggingFace datasets库提供便捷加载接口。用户可通过load_dataset函数指定配置名称'products'或'images'分别获取产品元数据与图像数据,二者以ean字段为键进行关联,图像索引通过image_sha256字段指向,实现了灵活的数据整合。在使用过程中,需注意AVIF图像的解码需额外安装pillow-avif-plugin插件。数据集的用途聚焦于研究及化学废弃物分类工具的构建,其原始图像存储方式支持高分辨率标签识别任务,而化学评估标签则适用于监督学习场景。对于需要完整图像集合的场景,建议采用images配置,以确保多视角信息的获取。数据来源与采集时间均有详细记录,保障了研究的可追溯性。
背景与挑战
背景概述
ean-product-dataset是由Kemipilot研究者于2026年创建的丹麦商品条码数据集,旨在通过收集电商平台公开产品页面,建立条码与商品名称、描述、图像、零售商及安全数据表之间的映射,以支持化学废弃物分类等应用。该数据集包含约97.8万种商品,覆盖151家商店,并创新性地提供了未经处理的原始图像及基于内容哈希的图像去重策略。其核心研究问题在于利用日常商品条码信息,推动环境可持续性研究,尤其在化学品安全分类领域具有显著影响力,为智能废弃物管理提供了数据基础。
当前挑战
该数据集面临的挑战首先源于领域问题的复杂性:准确关联条码与商品信息并判断化学品属性,需处理多源异构数据的语义匹配,以及区分“未评估”与“非危险”的模糊概念。其次,构建过程中遭遇多重技术难点,包括零售商使用的前端图片格式多样(如AVIF需专门插件)、约97.9万产品的海量图像存储与去重,以及确保条码校验码的准确性以防误混。此外,数据权利管理亦是一大挑战,尽管数据集公开,但需尊重原始零售商的版权,且在图像标签为占位符时需保留而非删除,以维持透明度,这些因素共同影响了数据集的持续更新与可用性。
常用场景
经典使用场景
该数据集以丹麦语网络商店为数据源,系统采集了近百万件商品的EAN条码、名称、描述、图像及安全数据表链接,构建了一个多模态、多配置的条码-商品映射库。其经典使用场景包括基于条码的商品识别与信息检索,如通过条码查询商品详情、图像比对或化学属性评估,以及作为电商平台、化学品管理工具和产品数据库建设的基准数据,支撑从单一商品查询到大规模商品分类的多样化任务。
解决学术问题
该数据集为商品信息领域的研究提供了稀缺的条码级、多模态资源,解决了以往公开数据中图像与文本脱节、条码校验缺失和商品化学属性标注不足的问题。它使研究者得以开展跨模态检索、商品图像识别、条码纠错及化学品类自动评估等课题,尤其填补了丹麦语环境下商品数据稀缺的空白,推动多语言商品信息处理和环境化学安全领域的理论与实证研究。
实际应用
在实际应用中,该数据集可直接用于开发手机扫描条码即得商品信息的应用,辅助消费者识别产品成分或安全警示;支撑社区或市政的化学废弃物智能分类系统,通过条码快速判断物品是否为化学品并引导正确处置;还为电商平台提供商品规范化、去重和图像校验服务,以及为零售商提供数据备份和版权追踪工具,展现出从消费端到管理端的广泛实用价值。
数据集最近研究
最新研究方向
该EAN产品数据集最新研究方向聚焦于构建多模态商品识别系统,深度融合条码元数据与视觉信息,以应对丹麦电商环境中废弃物分类的精准化需求。前沿研究强调图像存储的原始性与哈希去重策略,确保深度学习模型在标签识别时具备高保真输入,同时通过‘is_chemical’三元标签处理未评估商品的化学属性模糊性,推动化学安全领域的数据驱动决策。数据集的跨域整合能力,如关联零售商合规数据表与多视角图像,为细粒度商品理解、环保合规审查及智能回收技术提供了坚实基础,其开放性设计亦促进了跨国界、多语言的商品知识图谱构建,对实现循环经济与公共健康监测具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务