Supermarket Sales Tracker Dataset
收藏资源简介:
该数据集包含与客户购买行为和人口统计特征相关的多种变量。产品相关变量包括行业、类型、生产线、子生产线、包装、重量、产品描述等。交易细节包括日期、交易、订单、数量、价格等。客户人口统计信息包括客户编号、子女数量、资历、年龄、教育程度、婚姻状况、州、性别等。这些变量提供了关于客户购买行为的详细信息,使公司能够更好地理解其人口统计特征以及他们与不同产品类别的互动。
This dataset encompasses a variety of variables associated with customer purchase behavior and demographic traits. Product-related variables cover industry, category, product line, sub-product line, packaging, weight, product description, and so on. Transaction details include date, transaction record, order, quantity, price, and other relevant metrics. Customer demographic information encompasses customer ID, number of children, tenure, age, educational attainment, marital status, state of residence, gender, and more. These variables offer comprehensive insights into customer purchase behavior, allowing enterprises to gain a deeper understanding of their demographic profiles and their engagement with different product categories.
超市销售数据集
项目概述
该项目应用多种机器学习模型分析一个真实世界的数据集。聚类技术(如聚类)已被用于根据客户的购买行为和人口统计特征对客户进行分段。此外,分类模型(如决策树和逻辑回归)在需要根据不同标准对客户进行分类的特定情况下使用。未来,回归模型将被应用于预测变量之间的趋势和定量关系,使公司能够预测未来的行为并优化其业务策略。这种深入分析将使营销和销售行动能够定制化,从而在各个产品领域改善结果。
业务背景
该数据集来自一家寻求基于客户行为优化其营销和销售策略的公司。此分析的主要目标包括:
- 客户分段:根据人口统计特征(如年龄、婚姻状况、教育水平)和购买模式(如产品偏好、消费习惯)将客户分组。
- 产品领域分析:分析产品领域以识别特定类别、系列和子系列的销售额趋势和客户行为。
通过利用聚类,公司旨在:
- 个性化营销策略:针对每个客户群体定制营销活动,提供相关产品和促销。
- 识别新的商业机会:发现潜在市场或客户需求,可以通过新产品开发或扩展到不同领域来解决。
- 改善客户体验:通过了解客户的特定需求和偏好,提供更个性化的服务,从而提高客户满意度和忠诚度。
数据描述
数据集包含与客户购买和人口统计相关的多种变量:
- 产品相关变量:
Industry,Type,Line,Subline,Presentation,Weight,Product,Description - 交易详情:
Date,Transaction,Order,Quantity,Price,Max_Price,Max_Price_Dif,Amount - 客户人口统计:
Customer,Customer_Key,No._Children,Seniority,Age,Age_Range,Education,Marital_Status,State,Sex - 业务标识符:
Company,Year - 其他变量:
Function,Group
这些变量提供了关于客户购买行为的详细信息,使公司能够更好地理解他们的人口统计特征以及他们与不同产品类别的互动方式。
使用的聚类算法
以下聚类算法在本项目中使用:
- K-Means聚类:一种经典的分区算法,根据距离将每个数据点分配到最近的聚类中心。
- 凝聚聚类:适用于创建聚类层次结构,基于相似性将数据加入到更大的组中,从每个数据点作为自己的聚类开始。它特别适用于揭示数据的层次结构。
使用的分类算法
以下分类算法在本项目中使用:
- 决策树:一种基于规则的分层模型,通过连续分割数据来选择最大化类间分离的特征。它对于清晰和可视化的决策过程解释非常有用。
- 逻辑回归:一种统计模型,用于预测实例属于特定类的概率。它特别适用于二分类问题,允许通过sigmoid函数建模特征和类之间的关系。
这两种算法为数据的分类提供了有价值的见解,并帮助优化模型的性能。
要求
确保安装以下Python库:
pandasnumpymatplotlibscikit-learn




