Great American Coffee Taste Test
收藏资源简介:
该数据集来自Great American Coffee Taste Test,用于探索和发现咖啡爱好者的共同偏好。数据集在Kaggle上获取,经过清洗和处理后用于数据可视化和分析。
This dataset is derived from the Great American Coffee Taste Test, and is designed to explore and uncover the shared preferences of coffee enthusiasts. It is obtained from Kaggle, and after undergoing cleaning and preprocessing, it is utilized for data visualization and analysis.
咖啡偏好模式数据集 ☕
目标
调查和发现常见的咖啡偏好。
数据处理流程
数据集从Kaggle下载后,使用Python和Pandas、Numpy、Matplotlib等库进行数据清洗和处理,以便于可视化和获得更好的结果。
ETL过程
提取
从Kaggle下载数据集,链接为:https://www.kaggle.com/datasets/joebeachcapital/coffee-taste-test
转换
数据集非常脏,需要进行适当的更改以准备用于图形和可视化。首先导入Pandas、Numpy和Matplotlib等库,探索收集的数据以更好地理解,包括发现不一致的数据。发现一些不可用的列,这些列有大量的缺失值或不相关,因此丢弃了它们。随后,一些信息被合并为一个,为了解决这个问题,将它们分离为值列表。为了填补一些缺失的数据而不大幅改变未来的结果,使用箱线图进行可视化,以深入理解某些列,然后发现最佳的填充值。最后,将数据保存为CSV文件以在Power BI中使用,但发现了一个大错误,列值为列表,使用Power BI工具几乎不可能进行可视化。在尝试使用微软应用程序解决问题后,得出结论,无法在那里完成所需的操作。回到VsCode,创建了一些循环来滚动列表和每个项目的出现次数,成功地将结果保存为新表,这样就不会有Power BI的问题。
加载
清洗数据后,加载更新版本的数据,只有这样才能开始使用可视化工具。




