遇见数据集

steam-games-semanticIds-instructions

收藏
Hugging Face2026-07-22 更新2026-07-23 收录
官方服务:

资源简介:

Steam Games Semantic ID Instruction-Tuning Dataset是一个用于指令微调(SFT)的数据集,旨在将Steam游戏目录项与语义ID(即通过RQ-VAE在项目嵌入上训练得到的短离散代码)配对。该数据集用于微调模型,使其能够在语义ID空间中进行推理,而不是直接处理原始项目ID或嵌入,从而提升推荐系统等任务的效果。数据规模包括299,491个训练示例和16,118个验证示例,并包含1,026个特殊标记,用于表示语义ID词汇表(包括起始、结束标记以及每个层级和代码对的标记)。数据模式遵循Alpaca风格,每个示例包含instruction、input、output和task字段,其中task字段用于可追溯性,可根据需要省略。数据集支持多种任务:sequential(基于用户游戏历史预测下一项的语义ID)、grounding_name2id和grounding_id2name(实现游戏名称与语义ID之间的双向映射)、similar_item(基于用户共现行为推荐相似游戏)、asy(基于LC-Rec方法的变体,目标以游戏名称而非语义ID呈现)。在构建过程中,数据集仅包含约8,500个实际出现在用户游戏序列中的项目(而非完整约93k的目录),以确保每个项目有足够的重复曝光供学习;通过上下限重平衡任务来防止模型因流行度偏差而走捷径;训练/验证分割按目标组进行,避免重复目标泄漏。该数据集适用于文本生成、推荐系统和语义ID相关研究,特别是在游戏推荐和用户行为建模场景中。

The Steam Games Semantic ID Instruction-Tuning Dataset is a dataset for instruction fine-tuning (SFT), designed to pair Steam game catalog items with semantic IDs (i.e., short discrete codes trained via RQ-VAE on item embeddings). This dataset is used to fine-tune models to reason in semantic ID space rather than directly processing raw item IDs or embeddings, thereby improving the performance of tasks such as recommendation systems. The data scale includes 299,491 training examples and 16,118 validation examples, with 1,026 special tokens representing the semantic ID vocabulary (including start, end tokens, and tokens for each level and code pair). The data format follows the Alpaca style, with each example containing instruction, input, output, and task fields, where the task field is for traceability and can be omitted as needed. The dataset supports multiple tasks: sequential (predicting the semantic ID of the next item based on user game history), grounding_name2id and grounding_id2name (achieving bidirectional mapping between game names and semantic IDs), similar_item (recommending similar games based on user co-occurrence behavior), and asy (a variant based on the LC-Rec method, with targets presented as game names rather than semantic IDs). During construction, the dataset only includes approximately 8,500 items that actually appear in user game sequences (rather than the full catalog of about 93k), to ensure sufficient repeated exposure for learning each item; it uses upper-limit rebalancing tasks to prevent models from taking shortcuts due to popularity bias; and the training/validation split is performed by target group to avoid duplicate target leakage. This dataset is suitable for text generation, recommendation systems, and semantic ID-related research, particularly in scenarios such as game recommendation and user behavior modeling.

创建时间:
2026-07-12
原始信息汇总

Steam Games — Semantic ID Instruction-Tuning 数据集

数据集概述

本数据集是一个用于指令微调(SFT)的配对数据集,将 Steam 游戏目录项与其语义 ID(基于 RQ-VAE 从物品嵌入中提取的短离散编码)配对。数据集用于微调模型,使其能够在语义 ID 空间中进行推理,而非使用原始物品 ID 或嵌入。

数据集规模

  • 训练集:299,491 条示例(sft_train.jsonl)
  • 验证集:16,118 条示例(sft_val.jsonl)

特殊标记

1,026 个特殊标记,包括:

  • <|sid_start|>:语义 ID 起始标记
  • <|sid_end|>:语义 ID 结束标记
  • <|sid_L{level}_{code}|>:每个(层级,编码)组合对应的标记

数据格式

每条数据为 Alpaca 风格的三元组,外加一个 task 字段:

  • instruction:指令
  • input:输入
  • output:输出
  • task:任务类型(用于追溯,如框架要求严格三键格式可删除该字段)

任务类型

任务 描述
sequential 根据用户游玩历史(从最多到最少游玩),预测下一个物品的语义 ID
grounding_name2id 从物品名称到语义 ID 的映射
grounding_id2name 从语义 ID 到物品名称的映射
similar_item 根据真实用户共同参与行为(共现关系),从一个物品推荐另一个物品
asy(LC-Rec,arXiv 2311.09049) 与 sequential 使用相同的游玩历史/目标配对,但目标以物品名称而非语义 ID 呈现

构建说明

  • 物品筛选:仅包含实际出现在用户游玩序列中的约 8,500 个物品(而非完整目录的约 93,000 个),确保每个物品有足够高的重复曝光率以支持学习。
  • 数据平衡:针对每个任务进行上下限再平衡。由于实际使用数据存在明显的流行度偏斜,通过限制任何单个目标的示例数量,避免模型总选择流行答案;对低频目标进行补足,使其获得足够的重复训练。
  • 数据集划分:按目标组划分训练/验证集,而非按单条示例划分,防止同一目标的过采样近重复样本在划分间泄漏。
搜集汇总
数据集介绍
steam-games-semanticIds-instructions 数据集图片
构建方式
该数据集立足于推荐系统与语义ID技术交叉领域,旨在通过指令微调使语言模型掌握对语义标识符的推理能力。构建时首先将Steam游戏目录中约8,500个实际出现在用户游玩序列中的项目提取出来,利用基于项目嵌入训练的RQ-VAE为每个游戏生成短离散语义ID。随后,基于Alpaca风格的三元组结构,为每一条样本设计了明确的指令、输入与输出字段,并额外附加任务标签以增强可追溯性。为消除流行度偏差,数据集对每个任务中的目标项进行了地板和天花板重平衡:限制热门目标项的样本总数,同时为低频项提供足够的重复曝光。训练集与验证集按目标组而非单一样本划分,有效防止过采样带来的数据泄漏。
特点
该数据集具备鲜明的结构特征与任务多样性。其语义ID词汇表包含1,026个特殊标记,涵盖起始、结束符以及每个层级与编码对应的离散令牌,为模型学习结构化推理提供了符号基础。数据覆盖五种代表性任务:基于用户历史序列的后续游戏推荐、物品名称与语义ID的双向映射、基于共现关系的相似物品检索,以及兼容LC-Rec方法的文本化推荐。此外,约30万条训练样本和1.6万条验证样本的规模,结合严格的重采样策略,使数据集在避免模型走捷径的同时,确保了低频物品的可学习性,从而模拟了真实世界中分布不均的交互场景。
使用方法
该数据集可直接用于文本生成类模型的指令微调。使用时,用户可读取JSONL格式的SFT样本,每行包含instruction、input、output与task字段,若框架仅支持严格的三键格式,可移除task字段。模型需在分词器中注册1,026个语义ID特殊标记,并确保输入输出中包含`<|sid_start|>`和`<|sid_end|>`等界定符。推荐基于Qwen3-4B等架构进行微调,以学习将游戏描述或历史序列映射至语义ID空间。开发者可依据task字段筛选特定任务进行训练,也可混合所有任务以提升模型对语义ID的泛化推理能力。
背景与挑战
背景概述
该数据集由研究者pblrvo等人于近期构建,旨在推动推荐系统中语义ID推理能力的微调研究。核心研究问题在于如何将大型语言模型(LLM)与离散语义编码空间相融合,以替代传统基于原始物品ID或嵌入向量的推荐范式。数据集基于Steam游戏平台约8500个实际出现于用户游玩序列的物品,通过RQ-VAE模型生成语义ID,并构建了涵盖序列预测、名称-ID映射及相似物品推理等任务的指令微调样本。其影响力体现在为LLM驱动的推荐系统提供了一种新颖的语义ID训练范式,有望提升模型的泛化性与可解释性,为推荐领域与自然语言处理的交叉研究开辟新方向。
当前挑战
该数据集面临的核心挑战包括:领域问题方面,传统推荐系统依赖原始物品ID或嵌入向量,导致模型难以捕捉语义关联与长尾物品的表示能力,且存在冷启动与流行度偏差问题;构建过程中,需解决物品目录庞大(约9.3万)但活跃物品稀疏(约8500)带来的学习效率问题,通过限制物品范围确保重复曝光足够;同时,需应对流行度分布极度倾斜导致的模型捷径学习风险,采用每任务目标值的上下限重平衡策略,强制模型关注输入特征而非仅猜测热门答案;此外,训练验证集按目标组划分避免了近重复样本的跨集泄露,增加了数据划分的复杂性。
常用场景
经典使用场景
该数据集专为基于语义ID的推荐系统指令微调而设计,经典使用场景是将Steam游戏目录中的项目映射为短离散语义编码,通过训练模型在语义ID空间中推理,而非依赖原始物品ID或嵌入向量。数据集包含约30万条训练样本和1.6万条验证样本,采用Alpaca风格的指令格式,覆盖序列推荐、名称与ID双向映射、相似物品检索以及基于历史行为的目标预测等多种任务类型,为研究者在游戏推荐领域提供标准化、可复现的评测基准。
解决学术问题
该数据集系统性地解决了推荐系统中物品冷启动与稀疏交互的学术难题,通过引入RQ-VAE训练得到的语义ID,使模型习得物品语义层面的泛化能力,而非仅记忆流行物品的ID。同时,通过频次重采样策略(天花板与地板限制)消除了长尾分布导致的捷径学习现象,确保模型对稀有物品的预测性能也能得到充分训练,推动了语义化推荐方法在真实场景下的鲁棒性研究。
衍生相关工作
该数据集推动了语义化推荐与指令微调交叉方向的系列研究,衍生出诸如将语义ID引入大型语言模型进行可控生成式推荐的工作,以及探索不同粒度语义编码对序列建模效果影响的分析。其构建范式——结合指令微调、语义离散编码与频次对抗策略——启发了后续在短视频、电商等领域的同类数据集设计,并催生了面向游戏场景的细粒度推荐评测基准,为语义推荐范式的迁移验证提供了关键资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务