遇见数据集

jjovalle99/amazon_metadata_datathon_2023

收藏
Hugging Face2023-08-03 更新2024-03-04 收录
官方服务:

资源简介:

数据集amazon_metadata_datathon_2023包含多个特征,如购买相关商品、查看相关商品、商品ASIN、品牌、类别等,适用于分析和处理亚马逊商品的元数据。数据集分为训练集,包含超过1400万条记录和约945GB的数据量。

数据集amazon_metadata_datathon_2023包含多个特征,如购买相关商品、查看相关商品、商品ASIN、品牌、类别等,适用于分析和处理亚马逊商品的元数据。数据集分为训练集,包含超过1400万条记录和约945GB的数据量。

提供机构:
jjovalle99
原始信息汇总

数据集概述

数据集名称

  • 名称: amazon_metadata_datathon_2023

数据集配置

  • 配置名称: default
  • 数据文件:
    • 分割: train
    • 路径: data/train-*

数据集特征

  • also_buy: 字符串序列
  • also_view: 字符串序列
  • asin: 字符串
  • brand: 字符串
  • category: 字符串序列
  • date: 字符串
  • description: 字符串序列
  • feature: 字符串序列
  • fit: 字符串
  • image: 字符串序列
  • main_cat: 字符串
  • price: 字符串
  • rank: 字符串
  • similar_item: 字符串
  • tech1: 字符串
  • tech2: 字符串
  • title: 字符串

数据集分割

  • 分割名称: train
  • 数据大小: 94514841011 字节
  • 示例数量: 14213059

数据集大小

  • 下载大小: 17473856738 字节
  • 数据集总大小: 94514841011 字节
搜集汇总
数据集介绍
jjovalle99/amazon_metadata_datathon_2023 数据集图片
构建方式
该数据集源自亚马逊商品元数据,专为2023年数据马拉松赛事构建。其构建过程整合了海量商品信息,涵盖超过1400万条训练样本,数据规模达94.5GB。每条记录包含asin、品牌、类别、价格、排名、商品描述、功能特性、图片链接、关联购买与浏览商品、相似商品等多元字段,通过结构化的特征工程将非结构化文本与序列数据统一整理,形成适用于机器学习任务的标准化数据集。
特点
该数据集的核心特点在于其丰富的商品元数据维度,共包含18个特征字段,如also_buy和also_view序列字段揭示了商品间的协同购买与浏览关系,category和main_cat提供了多级分类信息,description和feature字段蕴含详尽的商品文本描述。此外,price、rank、brand等字段为价格分析和品牌研究提供了基础。数据集的庞大规模与多维特征使其成为商品推荐、市场分析、文本挖掘等任务的理想选择。
使用方法
使用该数据集时,可通过HuggingFace Datasets库直接加载,指定config_name为'default',split为'train'即可获取全部训练数据。数据以序列化形式存储,便于进行自然语言处理任务,如利用title和description字段训练商品标题生成模型,或基于also_buy和also_view构建协同过滤推荐系统。研究者亦可对price、rank等数值字段进行统计分析,或对category、main_cat进行分层抽样以平衡类别分布。
背景与挑战
背景概述
在电子商务领域,商品元数据是驱动推荐系统、搜索排序与用户行为分析的核心基石。由jjovalle99于2023年发起的amazon_metadata_datathon_2023数据集,源自亚马逊公开的商品信息,汇集了超过1400万条商品记录,涵盖品牌、类别、价格、关联购买(also_buy)与关联浏览(also_view)等丰富特征。该数据集旨在为研究者提供一个大规模、多维度的商品关系图谱,以探索跨品类推荐、价格预测与用户偏好建模等前沿问题。其发布不仅推动了电子商务数据挖掘竞赛的进程,也为学术界和工业界构建更精准的个性化服务提供了宝贵的基准资源,影响力辐射至信息检索与计算广告等多个交叉领域。
当前挑战
该数据集面临的核心挑战之一在于处理电子商务领域固有的数据稀疏性与噪声问题。商品元数据中大量缺失的品牌、价格或描述信息,以及“also_buy”和“also_view”关系链中的长尾分布,使得模型难以捕捉完整的用户-商品交互模式。此外,构建过程中需应对海量数据的高效清洗与标准化,例如不同格式的价格字段(如字符串与数值混存)和层级分类体系的对齐。更严峻的是,数据中隐含的偏差——如热门商品过度关联导致的流行度偏见——可能误导推荐算法,从而加剧信息茧房效应,这要求后续研究必须设计鲁棒的纠偏机制以保障模型的公平性与泛化能力。
常用场景
经典使用场景
在电子商务与推荐系统研究领域,亚马逊商品元数据集(Amazon Metadata Datathon 2023)作为一项涵盖逾1400万条商品记录的大规模结构化资源,广泛应用于商品关联分析、协同过滤推荐及多模态特征融合等经典场景。研究者可依托其丰富的字段,如同时购买(also_buy)、同时浏览(also_view)、商品描述(description)与价格(price),构建基于图神经网络的商品共现关系模型,或利用品牌(brand)、类别(category)等属性进行层次化商品聚类。该数据集凭借其庞大的样本量与多维特征,成为验证推荐系统鲁棒性与可扩展性的理想基准。
解决学术问题
该数据集有效解决了电子商务学术研究中长期存在的两大瓶颈:稀疏性挑战与冷启动问题。通过提供海量商品的关联购买与浏览记录,它为探索用户行为模式中的隐式反馈机制提供了坚实的数据基础,助力学术界在矩阵分解与深度学习推荐模型间搭建桥梁。同时,丰富的商品属性(如描述文本、品牌与图像链接)使得跨模态嵌入学习成为可能,从而缓解了新商品因缺乏交互记录而难以被精准推荐的困境。其意义在于,它推动了从单一点击率预测向多目标优化(如多样性、新颖性)的范式转变,并促进了可解释推荐算法的研究。
衍生相关工作
基于该数据集,学术界衍生出了一系列具有影响力的研究工作。在推荐系统领域,研究者利用其商品关联图(also_buy)提出了改进的GraphSAGE与LightGCN模型,显著提升了长尾商品的推荐精度;在自然语言处理方向,商品标题(title)与描述(description)被用于训练领域特定的词向量与文本分类器,推动了电商场景下的情感分析与产品属性抽取任务。此外,部分工作聚焦于价格预测与排名优化,通过融合时序特征与商品属性,构建了基于梯度提升与注意力机制的竞价策略模型。这些衍生工作不仅验证了数据集的通用性,更拓展了其在多模态学习与因果推断等前沿方向的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务