遇见数据集

KGD-dataset

收藏
Hugging Face2026-08-05 更新2026-08-06 收录
官方服务:

资源简介:

该数据集是 Amazon Reviews 2023 的一个预处理子集,专为训练和评估 KGD(Knowledge–Geometry Decoupling)与 ManCAR 模型而设计。它覆盖了 8 个产品类别(按字母顺序排列):Arts_Crafts_and_Sewing、Beauty_and_Personal_Care、CDs_and_Vinyl、Cell_Phones_and_Accessories、Office_Products、Software、Toys_and_Games、Video_Games。每个类别都提供了经过严格后处理 pipeline 的数据,包括:按时间排序并采用留一法分割的用户交互序列(训练/验证/测试集)、基于 LightGCN 的协同嵌入(维度256)、基于 Qwen3 的语义嵌入(维度32,从物品标题和层次类别编码而来)、以及用于 ManCAR 的 Manifold-Constrained Swing 图。数据处理流程还包含词汇一致性过滤,确保验证/测试集中不出现训练集未见的物品,从而避免数据泄露。数据集主要用于序列推荐(下一项预测)以及利用协同和语义嵌入的预训练-迁移方法研究。不适用于用户身份识别或高风险决策。使用时需引用原始数据集并说明采用了上述后处理流程。

This dataset is a preprocessed subset of Amazon Reviews 2023, specifically designed for training and evaluating KGD (Knowledge–Geometry Decoupling) and ManCAR models. It covers 8 product categories (in alphabetical order): Arts_Crafts_and_Sewing, Beauty_and_Personal_Care, CDs_and_Vinyl, Cell_Phones_and_Accessories, Office_Products, Software, Toys_and_Games, and Video_Games. Each category provides data processed through a strict post-processing pipeline, including: user interaction sequences sorted by time and split by leave-one-out (training/validation/test sets), collaborative embeddings based on LightGCN (dimension 256), semantic embeddings based on Qwen3 (dimension 32, encoded from item titles and hierarchical categories), and a Manifold-Constrained Swing graph for ManCAR. The data processing pipeline also includes vocabulary consistency filtering to ensure that no unseen items from the training set appear in the validation/test sets, thereby avoiding data leakage. The dataset is mainly used for sequential recommendation (next-item prediction) and research on pretraining-transfer methods utilizing collaborative and semantic embeddings. It is not suitable for user identification or high-risk decision-making. When using, please cite the original dataset and mention that the above post-processing pipeline has been applied.

创建时间:
2026-08-02
原始信息汇总

KGD数据集概述

基本信息

  • 许可证: MIT
  • 任务类型: 其他(推荐系统相关)
  • 标签: 推荐系统、序列推荐、亚马逊评论

数据集简介

该数据集是 Amazon Reviews 2023 的预处理子集,用于训练和评估 KGD(知识-几何解耦)模型,以 ManCAR 作为骨干网络。数据集不仅包含交互数据划分,还包含 KGD 所需的辅助信号:

  • 可直接训练的用户交互序列(train/valid/test
  • 用于 BMTP 预训练的协同和语义物品嵌入
  • 用于 ManCAR 的流形约束摆动图

覆盖类别(8类)

  1. Arts_Crafts_and_Sewing
  2. Beauty_and_Personal_Care
  3. CDs_and_Vinyl
  4. Cell_Phones_and_Accessories
  5. Office_Products
  6. Software
  7. Toys_and_Games
  8. Video_Games

后处理流程(按类别进行)

  1. 时间排序与留一法划分:交互按时间排序形成用户行为序列,并采用留一法策略划分为训练/验证/测试集。
  2. 词汇一致性过滤:基于训练集构建物品词汇表,移除验证/测试集中包含未见物品的目标或历史记录,防止训练-测试泄漏。
  3. 协同嵌入:使用 LightGCN 在仅含训练集边的用户-物品图上训练 256 维嵌入。
  4. 语义嵌入:使用 Qwen3 文本嵌入模型对物品标题和层级类别编码成 32 维嵌入。
  5. 摆动图:构建物品-物品摆动相似度图,为 ManCAR 提供流形约束监督。

目录结构(以Software类别为例)

  • processed_llo_graph/Software/
    • Software.train.csvSoftware.valid.csvSoftware.test.csv — 用户交互序列
    • Software.item.csv — 物品表(含重映射的物品ID和附加信息)
    • graph/swing.parquet — ManCAR 的流形约束摆动图
  • graph_emb/Software/graph_emb.csv — 协同(LightGCN)物品嵌入(BMTP)
  • text_emb/Software/text_emb.csv — 语义(Qwen3)物品嵌入(BMTP)

预期用途

该数据集主要用于以下研究:

  • 序列推荐 / 下一项预测
  • 利用协同和语义物品嵌入的预训练-迁移方法

不适用于用户身份识别或任何高风险决策场景。

许可与引用

  • 数据集衍生自 Amazon Reviews 2023,请参考原始数据集页面了解许可、使用条款和归属要求:https://amazon-reviews-2023.github.io/
  • 使用该处理数据集时,请引用原始数据集并明确说明使用了上述后处理管线的子集。
  • 相关论文:https://arxiv.org/abs/2608.02738
  • 相关代码:https://github.com/FuCongResearchSquad/KGD4REC
搜集汇总
数据集介绍
KGD-dataset 数据集图片
构建方式
KGD-dataset源自Amazon Reviews 2023,精选8个商品类别,经过严格的后处理流程构建而成。首先,交互数据按时间戳排序形成用户行为序列,并采用留一法划分训练、验证和测试集。其次,为确保词汇一致性,剔除验证和测试集中包含未登录目标项或历史项的样本,防止数据泄露。随后,利用LightGCN在训练集构建的用户-物品图上训练256维协同嵌入,同时使用Qwen3对物品标题和层级类别编码生成32维语义嵌入。此外,还构建了物品间的Swing相似度图,为ManCAR模型提供流形约束监督。每个类别均提供完整的交互序列、物品表、图数据和嵌入文件,便于直接使用。
使用方法
该数据集专为顺序推荐和下一项预测研究设计,尤其适合预训练-迁移方法。用户可直接使用提供的train/valid/test文件进行模型训练和评估,无需额外预处理。其协同和语义嵌入文件可直接用于BMTP预训练,Swing图则用于ManCAR的流形约束学习。研究人员可加载各类别目录下的CSV和parquet文件,结合KGD模型代码库进行实验。数据集的模块化结构允许灵活选择单一或多类别数据,便于跨域迁移研究。使用时需遵循原始Amazon Reviews 2023的许可条款,并引用相应论文。
背景与挑战
背景概述
KGD-dataset源自Amazon Reviews 2023,由研究团队为验证KGD(知识-几何解耦)方法而构建,该团队包括来自高校与企业的研究人员,提出了ManCAR模型作为骨干。数据集覆盖8个产品类别,为顺序推荐研究提供了精心预处理的数据,包含用户交互序列、协同与语义嵌入及流形约束图等辅助信号,旨在促进预训练-迁移方法的发展,其在推荐系统领域具有一定影响力。
当前挑战
该数据集面临的挑战涵盖领域与构建两方面。领域层面,顺序推荐需处理用户行为的动态演变与长尾分布,且传统图神经网络难以融合知识几何结构;构建层面,需确保时间序列划分无泄露(如剔除含未见物品的验证/测试样本),统一词汇表以避免训练-测试偏差,以及高效生成大规模协同与语义嵌入,并构建易于整合的流形约束图,这些均需严格的后处理流程加以保障。
常用场景
经典使用场景
该数据集为序列推荐与下一项预测研究提供了标准化的训练与评估基准。其按时间排序的用户交互序列,配合留一法的数据划分策略,使得研究者能够直接在多个商品类别上开展基于深度学习的序列建模实验。同时,数据集内置的协同与语义物品嵌入、以及流形约束的摇摆图,为预训练-微调范式的模型(如KGD)提供了完整的输入信号,从而支持对推荐系统中用户行为动态变化的精准捕获。
解决学术问题
该数据集解决了序列推荐中因数据稀疏和物品冷启动导致的预测精度不足、以及传统静态嵌入无法适应流式数据分布漂移的学术难题。通过提供时间顺序的交互序列和辅助嵌入,它助力研究者探索知识-几何解耦方法,以提升模型在有限监督下的泛化能力。其词汇一致性过滤和防泄漏处理,也为实现严谨的离线评估树立了标杆,推动推荐系统研究的可复现性。
实际应用
在实际应用中,该数据集可用于电商平台(如亚马逊)的个性化商品推荐、用户兴趣预测以及会话式购物辅助系统。基于其构建的推荐模型,能够实时分析用户行为序列,动态调整推荐策略,从而提高点击转化率和用户满意度。此外,其多类别覆盖使得模型在跨域迁移场景中具有良好适应性,适用于视频游戏、美妆个护等多个垂直领域。
数据集最近研究
最新研究方向
基于KGD数据集的构建,当前研究聚焦于融合知识图谱与几何约束的序列推荐范式革新。该数据集依托亚马逊评论2023多域语料,通过时间序划分与词汇一致性过滤,实现训练-验证-测试的严格隔离,规避信息泄露。结合LightGCN协同嵌入与Qwen3语义嵌入的双通道预训练,以及流形约束摇摆图的引入,为多模态特征解耦与可迁移推荐提供了高保真实验基座。后续探索将朝向流式场景下的动态表征刷新、跨域知识迁移及复杂交互建模,推动推荐系统从静态匹配向自适应认知演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务