遇见数据集

oyku-tugana/amazon-musical-instruments-2018-2023-5core

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是Amazon Reviews 2023数据集中音乐乐器类别的采样子集,专为数据挖掘课程推荐系统项目创建。采样策略包括:时间过滤(2018年1月1日至2023年9月12日)、迭代5核过滤(确保每个用户和物品至少有5次交互,直到稳定)、冷启动测试集(保留5000名用户,每人有1-2条评论用于冷启动评估)和随机种子42。数据集包含三个配置:interactions(交互数据)、items(物品数据)和cold_start(冷启动数据)。主要统计信息:25,746名用户、13,575个物品、222,276次交互、稀疏度0.999364、平均评分4.451,以及物品带有图像、描述和价格的比例。模式方面,交互/冷启动配置包含用户ID、物品ASIN、评分、时间戳等字段,物品配置包含物品ASIN、标题、描述、价格等字段。

This dataset is a sampled subset of the Musical Instruments category from the Amazon Reviews 2023 dataset, specially developed for recommender system projects in data mining courses. The sampling strategies include: temporal filtering (covering the period from January 1, 2018 to September 12, 2023), iterative 5-core filtering (ensuring each user and item has at least 5 interactions until the process stabilizes), a cold-start test set (retaining 5,000 users, each with 1-2 reviews for cold-start evaluation), and a fixed random seed of 42. The dataset includes three configurations: interactions (interaction data), items (item data), and cold_start (cold-start data). The main statistical metrics are: 25,746 users, 13,575 items, 222,276 interactions, a sparsity of 0.999364, an average rating of 4.451, and the proportion of items with images, descriptions and prices. For data schemas, the interactions and cold_start configurations contain fields such as user ID, item ASIN, rating, timestamp, etc., while the items configuration includes fields such as item ASIN, title, description, price, etc.

提供机构:
oyku-tugana
搜集汇总
数据集介绍
oyku-tugana/amazon-musical-instruments-2018-2023-5core 数据集图片
构建方式
本数据集源自Amazon Reviews 2023中Musical Instruments类目的核心子集,经由精细采样流程构建而成。首先,限定时间窗口为2018年1月1日至2023年9月12日,以捕捉近五年用户对乐器产品的评价行为。随后,采用迭代式5-core过滤策略,反复剔除交互次数不足5次的用户或商品,直至系统达到稳定状态,确保了每位用户与每件商品均具备足够稠密的交互记录。在此基础上,额外隔离出2991位仅拥有1-2条评价的用户作为冷启动测试集,旨在模拟真实推荐场景中新兴用户的行为模式。所有采样过程均以随机种子42保障可复现性,最终形成包含222,276条交互记录、13,575件商品及25,746位用户的高质量数据集合。
使用方法
该数据集通过HuggingFace Datasets库加载,以三种预定义配置供研究者按需使用。调用'load_dataset'时分别指定'interactions'、'items'或'cold_start'作为配置参数,即可获取对应的训练子集。交互与冷启动子集共享一致的列结构,包含用户标识、商品编码、评分、时间戳、帮助票数、验证购买标记及评论文本,适合序列推荐、评分预测及基于文本的情感分析任务。商品子集则提供标题、描述、特性、价格、星级均值等元信息,可服务于基于内容的推荐或图像特征注入。冷启动子集的设计尤为突出,可直接用于评估模型在仅有少量历史交互的用户上的泛化性能,是实现鲁棒推荐系统的理想基准。
背景与挑战
背景概述
在推荐系统研究领域,用户与物品交互数据的稀疏性和冷启动问题一直是制约模型泛化能力的关键瓶颈。为深入探索此类挑战,该数据集由Öykü Tuğana等人于2023年基于Amazon Reviews 2023语料库构建,专注于Musical Instruments类别,时间跨度覆盖2018年至2023年。通过迭代5-core采样策略,最终保留了25,746名用户、13,575个商品及222,276条交互记录,稀疏度高达0.999364,凸显了真实场景中交互数据的极端稀疏性。该数据集在推荐系统、协同过滤及冷启动评估等领域具有显著价值,为开发鲁棒性模型提供了标准化测试基准。
当前挑战
该数据集所应对的核心领域挑战在于推荐系统的数据稀疏性与冷启动问题。在Musical Instruments这一垂直领域中,用户行为模式高度异构,绝大多数交互集中于少数热门物品,导致模型难以捕获长尾商品和新兴用户的偏好。构建过程中,面临时间过滤与核心采样之间的平衡难题,确保数据代表性同时避免信息丢失。此外,注释缺失(如38.4%的商品缺少描述、22.2%缺失价格信息)增加了多模态特征融合的难度,冷启动测试集(2,991个用户仅含1-2条历史交互)进一步放大了预测的挑战性。
常用场景
经典使用场景
在推荐系统研究领域,amazon-musical-instruments-2018-2023-5core数据集凭借其经过五核迭代采样、时间跨度从2018年至2023年的精心构建,成为了评估协同过滤算法与序列推荐模型的经典基准。研究者通常利用其交互数据中的用户-物品二部图结构,训练矩阵分解或图神经网络等模型,以预测用户对乐器产品的偏好评分。该数据集的冷启动子集更是为测试模型在稀疏交互条件下的泛化能力提供了标准化的实验场景,使其在对比不同推荐策略的有效性时扮演着不可或缺的角色。
解决学术问题
该数据集的核心价值在于解决了推荐系统领域长期面临的冷启动问题与数据稀疏性挑战。通过单独划分出仅含少量交互的冷启动用户子集,它为学术界提供了一个真实模拟新用户行为的实验平台,从而推动了基于内容特征(如商品描述与图像)或元学习的跨域推荐方法的研究。此外,其高稀疏度(超过99.9%)的特性迫使研究者探索更为鲁棒的特征表示技术,如融合文本语义与视觉信号的多模态嵌入模型,这对于提升推荐系统在现实长尾场景中的准确性具有深远意义。
实际应用
在实际应用中,该数据集直接服务于电商平台乐器品类的个性化推荐引擎优化。基于其数据训练的模型可用于在线音乐商店(如Amazon或专业乐器零售商)实现“猜你喜欢”功能,通过分析用户历史评分与评论文本,推荐吉它、电子键盘或录音设备等商品。冷启动子集则帮助企业缓解新品推广的难题,利用商品详情页的标题与描述信息为新上架的产品匹配合适的潜在买家。此外,已验证购买标签(verified_purchase)的包含有助于过滤虚假评论干扰,提升推荐结果的可信度与实际转化率。
数据集最近研究
最新研究方向
该数据集聚焦于乐器品类电商评论的推荐系统前沿研究,通过5-core采样与冷启动场景构建,为序列化协同过滤、跨模态用户画像建模提供了高质量基准。结合2023年Amazon Reviews大规模语料,其完整收录图文描述、价格与购买验证等多元特征,推动了解释性推荐与冷启动物品表征学习的突破。当前热点方向包括基于大语言模型的评论语义增强、时序偏好动态演化建模,以及多模态融合下的个性化排序优化,为音乐器材等垂直电商领域的智能推荐迭代提供了关键训练与评估资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务