Walmart Sales Data|零售销售数据集|数据分析数据集
收藏数据集概述
数据来源
数据内容
- 包含17个列和1000行数据。
- 主要列包括:
invoice_id
: 销售发票IDbranch
: 销售分支city
: 分支所在城市customer_type
: 客户类型gender
: 客户性别product_line
: 产品线unit_price
: 产品单价quantity
: 销售数量VAT
: 增值税total
: 总销售额date
: 销售日期time
: 销售时间payment_method
: 支付方式cogs
: 商品成本gross_margin_percentage
: 毛利率gross_income
: 毛利rating
: 评分
数据分析目的
- 分析Walmart销售数据,了解表现最佳的分支和产品,销售趋势,客户行为。
- 研究如何改进和优化销售策略。
分析列表
- 产品分析:分析不同产品线,找出表现最佳和需要改进的产品线。
- 销售分析:分析产品销售趋势,评估销售策略的有效性。
- 客户分析:揭示不同客户细分市场,购买趋势和每个客户细分的盈利性。
分析方法
- 数据整理:检查并处理NULL值和缺失值。
- 特征工程:从现有列生成新列,如
time_of_day
、day_name
和month_name
。 - 探索性数据分析:回答项目目标中的问题。
业务问题
- 包括产品、销售和客户三个方面的多个问题,如产品线的销售情况、支付方式的普遍性、客户类型的购买趋势等。
收入和利润计算
- 计算公式包括商品成本、增值税、总销售额、毛利和毛利率。
可视化
- 计划创建多种图表,如销售趋势图、产品线销售表现图、客户类型分析图等,以深入理解数据。

CatMeows
该数据集包含440个声音样本,由21只属于两个品种(缅因州库恩猫和欧洲短毛猫)的猫在三种不同情境下发出的喵声组成。这些情境包括刷毛、在陌生环境中隔离和等待食物。每个声音文件都遵循特定的命名约定,包含猫的唯一ID、品种、性别、猫主人的唯一ID、录音场次和发声计数。此外,还有一个额外的zip文件,包含被排除的录音(非喵声)和未剪辑的连续发声序列。
huggingface 收录
中国1km分辨率逐月降水量数据集(1901-2023)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
Figshare
Figshare是一个在线数据共享平台,允许研究人员上传和共享各种类型的研究成果,包括数据集、论文、图像、视频等。它旨在促进科学研究的开放性和可重复性。
figshare.com 收录
中国高分辨率高质量PM2.5数据集(2000-2023)
ChinaHighPM2.5数据集是中国高分辨率高质量近地表空气污染物数据集(ChinaHighAirPollutants, CHAP)中PM2.5数据集。该数据集利用人工智能技术,使用模式资料填补了卫星MODIS MAIAC AOD产品的空间缺失值,结合地基观测、大气再分析和排放清单等大数据生产得到2000年至今全国无缝隙地面PM2.5数据。数据十折交叉验证决定系数R2为0.92,均方根误差RMSE为10.76 µg/m3。主要范围为整个中国地区,空间分辨率为1 km,时间分辨率为日、月、年,单位为µg/m3。注意:该数据集持续更新,如需要更多数据,请发邮件联系作者(weijing_rs@163.com; weijing@umd.edu)。 数据文件中包含NC转GeoTiff的四种代码(Python、Matlab、IDL和R语言)nc2geotiff codes。
国家青藏高原科学数据中心 收录
DeepPCB
DeepPCB是由上海交通大学图像处理与模式识别研究所创建的首个公开PCB缺陷检测数据集,包含1,500对标注了6种常见PCB缺陷位置的图像。数据集通过模板匹配技术确保图像对齐,减少预处理工作量。每对图像包括一个640x640像素的无缺陷模板和一个有缺陷的测试图像。数据集旨在解决PCB制造中的自动缺陷检测问题,提高检测效率和准确性。
arXiv 收录