oyku-tugana/amazon-musical-instruments-2014-2023-5core
收藏数据链接:
官方服务:
资源简介:
Amazon乐器类别—5核采样数据集(2018-2023)是Amazon Reviews 2023数据集中乐器类别的采样子集,专为数据挖掘课程的推荐系统项目创建。
Amazon Musical Instruments — 5-Core Sampled Dataset (2018-2023) is a sampled subset of the Amazon Reviews 2023 Musical Instruments category, created for a Data Mining course recommendation system project.
提供机构:
oyku-tugana搜集汇总
数据集介绍

构建方式
本数据集源自Amazon Reviews 2023中Musical Instruments类别的用户评论数据,经过精心的采样与筛选流程构建而成。首先,时间范围被限定在2014年1月1日至2023年9月12日之间,以确保数据的时效性。随后,应用迭代式5-core过滤策略,反复剔除交互次数不足5次的用户与物品,直至系统达到稳定状态,最终保留了53,127名用户与23,158件物品之间的473,647条交互记录。此外,针对冷启动推荐场景,特意从主数据集中分离出6,904名仅拥有1至2条评论的用户,形成独立的冷启动测试集。整个采样过程基于随机种子42进行,保证了结果的可复现性。
特点
该数据集具备多重显著特征。其一,稀疏度高达0.999615,真实反映了推荐系统中用户-物品交互矩阵的天然稀疏性,为算法鲁棒性评估提供了严苛的测试环境。其二,所有物品均附有图像信息,且超过69%的物品包含详细描述与价格数据,丰富的元数据为多模态推荐与内容感知模型的训练提供了坚实基础。其三,评分均值高达4.445,揭示了用户对乐器类商品普遍持正面评价的偏好倾向。其四,数据集被划分为interactions、items及cold_start三个配置,分别服务于常规协同过滤训练、物品特征检索以及冷启动评估,满足多样化研究需求。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集。具体而言,调用load_dataset函数并指定配置名称与划分即可获取相应子集:使用"interactions"配置加载主交互数据,包含用户ID、商品ID、评分、时间戳及评论文本等字段;使用"items"配置加载物品元数据,涵盖标题、描述、价格、类别及图像链接等信息;使用"cold_start"配置加载冷启动用户子集,其模式与interactions一致。若需进一步处理,可将数据转换为Pandas DataFrame格式进行探索性分析,或直接输入至推荐系统模型中训练与评估。
背景与挑战
背景概述
在推荐系统研究领域,Amazon Reviews数据集长期以来被视为评估协同过滤与序列推荐算法的基准资源。amazon-musical-instruments-2014-2023-5core数据集源自2023年发布的Amazon Reviews 2023语料库,由McAuley实验室团队主导构建,由Oyku Tugana针对数据挖掘课程项目抽样处理而成。该数据集聚焦于乐器品类,时间跨度从2014年至2023年,核心研究问题在于提升推荐系统在稀疏交互环境下的鲁棒性与冷启动场景下的预测能力。通过严格的5-core迭代采样策略,数据集保留了53,127名用户与23,158件商品间的473,647条交互记录,确保了数据质量与可复现性。该资源为理解电商推荐中的领域特性、用户行为模式以及多模态信息融合提供了重要支撑,在学术界与工业界均具有广泛影响力。
当前挑战
该数据集面临的核心挑战首先是推荐系统领域固有的稀疏性问题,其交互矩阵稀疏度高达0.999615,极低的用户-商品交互密度使得传统协同过滤方法难以有效学习用户偏好表征。冷启动场景构成另一关键挑战,数据集专门划分了6,904名具有1-2次交互的用户作为冷启动测试集,这些用户因历史行为匮乏而难以被现有推荐模型充分建模。构建过程中的挑战体现在多源数据整合与质量保障,尽管所有商品均包含图像信息,但描述与价格字段存在近30%的缺失率,这增加了多模态推荐模型设计与数据补全的难度。此外,评分分布呈显著正偏态(均值4.445),此类有偏反馈容易导致模型对高评分产生过度拟合,削弱其对用户真实反向偏好的识别能力。
常用场景
经典使用场景
在推荐系统研究领域,amazon-musical-instruments-2014-2023-5core数据集常被用于协同过滤与基于内容的推荐算法的训练与评估。研究者借助其中丰富的用户评分、文本评论及商品属性信息,探索如何在高度稀疏的交互矩阵中精准捕捉用户的潜在偏好。该数据集通过严格的5-core过滤策略,确保了每个用户和商品均有至少5次交互,为模型提供了足够稠密的训练信号,使得矩阵分解、图神经网络及Transformer架构等经典方法得以在乐器这一垂直品类上充分验证其性能。
实际应用
在实际应用中,该数据集支撑了音乐器材电商平台推荐引擎的优化。通过解析用户的评分与文本反馈,平台能够为潜在买家推荐契合其需求的吉他、合成器或电子鼓等商品,从而提升转化率与用户满意度。商品信息中的价格、描述与图像数据使得多模态检索与可视化推荐成为可能,帮助消费者在海量选品中快速定位高性价比乐器。此外,评论中的有用性投票与验证购买标识还可用于构建可信度评估模块,过滤虚假评价,增强推荐结果的可靠性与商业价值。
衍生相关工作
围绕该数据集衍生出了一系列极具影响力的学术工作。基于其交互与物品配置,研究者提出了融合商品标题与描述的语义嵌入模型,有效缓解了数据稀疏带来的表征偏差。冷启动配置催生了基于预训练语言模型的零样本推荐方法,利用评论语义生成新用户的兴趣向量。此外,该数据集还被用于对比实验,验证了对比学习与自监督图神经网络在稀疏场景下相对于传统协同过滤的优势。这些工作不仅提升了乐器品类推荐的效果,也为其他垂直领域的小样本推荐树立了方法论范本。
以上内容由遇见数据集搜集并总结生成



