遇见数据集

superkart-dataset

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

该数据集是一个零售销售数据集,记录了产品与商店的属性信息以及对应的销售数据。数据集包含8763条训练样本,涵盖12个特征字段,具体包括:产品标识(Product_Id)、产品重量(Product_Weight)、产品含糖量(Product_Sugar_Content)、产品分配区域(Product_Allocated_Area)、产品类型(Product_Type)、产品建议零售价(Product_MRP)、商店标识(Store_Id)、商店成立年份(Store_Establishment_Year)、商店规模(Store_Size)、商店所在城市类型(Store_Location_City_Type)、商店类型(Store_Type)以及产品在商店的总销售额(Product_Store_Sales_Total)。该数据集适用于零售分析、销售预测、产品推荐、商店运营优化等机器学习任务,可用于探索产品属性、商店特征与销售表现之间的关系。

创建时间:
2026-07-17
原始信息汇总
  • 数据集名称:superkart-dataset
  • 数据集大小:下载大小为213782字节,数据集大小为1358281字节
  • 数据划分:仅包含训练集(train),共8763个样本
  • 特征字段
    • Product_Id(字符串):产品ID
    • Product_Weight(浮点数):产品重量
    • Product_Sugar_Content(字符串):产品含糖量
    • Product_Allocated_Area(浮点数):产品分配区域
    • Product_Type(字符串):产品类型
    • Product_MRP(浮点数):产品最高零售价
    • Store_Id(字符串):商店ID
    • Store_Establishment_Year(整数):商店成立年份
    • Store_Size(字符串):商店规模
    • Store_Location_City_Type(字符串):商店所在城市类型
    • Store_Type(字符串):商店类型
    • Product_Store_Sales_Total(浮点数):产品在商店的总销售额
搜集汇总
数据集介绍
superkart-dataset 数据集图片
构建方式
superkart-dataset数据集旨在为零售行业的销量预测与品类分析提供结构化支持,其构建过程融合了产品属性与商店特征两大维度。数据集的每条记录代表特定产品在指定商店的销售情况,通过Product_Id与Store_Id实现跨实体关联。产品侧包含重量、糖含量、分配面积、类型及最高零售价等属性;商店侧则涵盖成立年份、规模、所在城市类型与业态模式。该数据集共收录8763条训练样本,以单一训练集形式划分,便于监督学习场景下的直接应用。
使用方法
使用superkart-dataset时,可直接通过HuggingFace Datasets库加载train分割数据,支持使用Python脚本进行数据探索与建模。用户需对Product_Sugar_Content、Store_Size等字符串字段进行类别编码,并对连续特征执行标准化或归一化处理。该数据集适用于回归预测任务,可基于LightGBM、XGBoost或神经网络等模型,利用特征工程后的数据对产品在商店的总销售额进行预测,并进一步探讨商店特征、产品属性与销售表现之间的隐含关联。
背景与挑战
背景概述
在零售与供应链管理领域,产品销售预测与库存优化是提升运营效率的核心议题。superkart-dataset是由某研究机构或团队创建的面向零售数据分析的数据集,旨在探究产品特征(如重量、糖含量、分配区域、类型及单价)与门店属性(如成立年限、规模、所处城市类型及业态)对销售总量的影响。该数据集收录了8763条训练样本,覆盖多元化的产品与门店组合,为构建回归预测模型、分析零售业关键驱动因素提供了实证基础,对推动数据驱动的零售决策具有显著价值。
当前挑战
该数据集所解决的领域问题在于零售销售预测中多维度特征交互的复杂性,例如产品属性(糖含量分为高/低/中三类)与门店类型(可能包括超市、便利店等)间的非线性关系,以及稀疏数据下模型泛化能力的挑战。在构建过程中,主要挑战包括:确保产品与门店标识的唯一性与一致性,处理产品糖含量等分类特征的标准化标注,以及平衡各销售区间样本分布以规避预测偏差,这些均对数据清洗与特征工程提出了严苛要求。
常用场景
经典使用场景
在零售与快消品领域,superkart-dataset数据集以其精细的商品与门店属性刻画,成为经典的商品销售预测与库存优化研究基准。该数据集涵盖了产品重量、含糖量、品类与定价等核心特征,以及门店的设立年份、规模、所处城市类型等多元环境变量,为构建回归与分类模型提供了丰富维度。研究者常利用其产品-门店层级的历史销售总量,探索特征工程对预测精度的提升作用,或作为时间序列与机器学习方法在零售需求预测中的通用验证平台。
解决学术问题
superkart-dataset主要解决了零售数据中因多源异构特征导致的销售驱动因素量化难题。学术研究长期受困于产品属性与门店环境如何交互影响销量的复杂机制,该数据集通过结构化整合商品类别、含糖量、定价策略与门店类型、城市区位等变量,使学者得以运用统计回归、决策树及神经网络等方法,剖析价格弹性、产品差异化及区位优势对销售绩效的贡献程度。其开放共享的特性推动了零售科学中需求分析与定价策略的实证研究进展。
实际应用
在实际商业场景中,superkart-dataset可赋能零售商实现精细化运营。基于产品重量、糖分含量与门店类型等特征,企业能够构建智能补货系统,针对不同城市与门店规模动态调整库存水平,减少缺货与滞销风险。同时,产品定价与销售总额的关联分析,有助于制定区域化促销策略,优化利润空间。该数据集还可用于训练推荐算法,根据门店特性与历史销量,向特定客户群体推送高匹配度的商品,提升转化率。
数据集最近研究
最新研究方向
当前,零售与快速消费品行业正经历着数据驱动的深刻变革,superkart-dataset作为融合商品属性、门店特征与销售表现的精细化零售数据集,成为探索多模态消费预测与智能库存管理的前沿基石。研究人员聚焦于基于产品含糖量、分配面积及门店类型等多元特征,构建混合模型以揭示不同商品类别在特定零售环境中的销售规律,尤其关注健康趋势对高糖产品的市场影响。此外,该数据集为近年来兴起的城市零售空间优化与季节性需求波动分析提供了实证支持,助力零售商在竞争激烈的市场环境中实现精准营销与可持续增长,其蕴含的异构属性关联性对未来可解释AI在零售领域的落地具有示范性意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务