遇见数据集

genrec-dataset

收藏
Hugging Face2026-08-10 更新2026-08-11 收录
官方服务:

资源简介:

genrec-dataset 是一个用于 SIDReasoner 的第二阶段推理数据集,包含由 Azure OpenAI GPT-5.4 生成的链式思维(chain-of-thought)推理轨迹。该数据集专为视频游戏领域的推理任务设计,旨在替代上游的推理轨迹,提供更高质量、多样化的推理过程数据。数据集包含多个子集(config),每个子集对应一个独立的 Parquet 文件,且仅包含训练集(train)。子集分为不同的 prompt 版本:v4、v5 和 v6,每个版本使用不同的生成提示模板。其中,共享相同 prompt 版本的子集(如 Video_Games_reasoning、Video_Games_reasoning_sample2、Video_Games_reasoning_sample3)是从相同的 49,133 行原始数据中以温度 1 独立采样得到的,行通过 _source_index 字段对齐,且推理文本不重复,适合用于多数投票、难度分层或数据增强。不同版本子集的推理文本格式有所差异:v4 生成 4-8 句的分析师独白(证据→兴趣→机制→预测);v5 生成 1-6 句的基于证据的推理,禁止复述完整历史;v6 生成 4-8 句的分析师独白(120-180 词),并额外包含物品描述,以便通过具体属性表征语义 ID 而不提及标题。所有 prompt 输出的每条记录均为严格的 JSON 对象,包含三个字段:predictability(可预测性)、transition_type(转移类型)和 reasoning(推理过程)。该数据集适用于训练和评估推荐系统中的推理模型,特别是基于思维链的强化学习(如 GRPO)训练。此外,数据集仓库还提供了训练好的模型检查点,包括 Stage-2 CoT 和 Stage-3 RL 检查点,可直接加载使用。

The genrec-dataset is a second-stage reasoning dataset for SIDReasoner, containing chain-of-thought reasoning trajectories generated by Azure OpenAI GPT-5.4. It is specifically designed for reasoning tasks in the video game domain, aiming to replace upstream reasoning trajectories with higher-quality and more diverse reasoning process data. The dataset includes multiple subsets (configs), each corresponding to an independent Parquet file, and only contains a training set (train). The subsets are divided into different prompt versions: v4, v5, and v6, each using a different generation prompt template. Subsets sharing the same prompt version (e.g., Video_Games_reasoning, Video_Games_reasoning_sample2, Video_Games_reasoning_sample3) are independently sampled from the same 49,133 rows of raw data at temperature 1, with rows aligned via the _source_index field, and the reasoning texts are non-repetitive, making them suitable for majority voting, difficulty stratification, or data augmentation. The reasoning text formats differ across versions: v4 generates 4-8 sentences of analyst monologue (evidence → interest → mechanism → prediction); v5 generates 1-6 sentences of evidence-based reasoning, prohibiting restating the full history; v6 generates 4-8 sentences of analyst monologue (120-180 words) with additional item descriptions, so that semantic IDs are characterized by specific attributes without mentioning titles. Each record output by all prompts is a strict JSON object containing three fields: predictability, transition_type, and reasoning. The dataset is suitable for training and evaluating reasoning models in recommendation systems, especially for chain-of-thought-based reinforcement learning (e.g., GRPO) training. Additionally, the dataset repository provides trained model checkpoints, including Stage-2 CoT and Stage-3 RL checkpoints, which can be loaded directly for use.

创建时间:
2026-08-04
原始信息汇总

genrec-dataset 数据集概述

基本信息

  • 数据集名称:genrec-dataset
  • 所属仓库mengdanzhu/genrec-dataset
  • 用途:为 SIDReasoner 提供的第二阶段推理数据,其中 reasoning_path 列包含使用 Azure OpenAI GPT-5.4 生成的思维链轨迹,替代了上游轨迹。

数据集结构

配置与数据划分

数据集包含 10 个子配置(config),每个配置仅包含 train 分割,数据文件以 Parquet 格式存储:

配置名 分割
Video_Games_reasoning train
Video_Games_reasoning_sample2 train
Video_Games_reasoning_sample3 train
Video_Games_reasoning_v4 train
Video_Games_reasoning_v5 train
Video_Games_reasoning_v6 train
Video_Games_reasoning_v6_sample2 train
Video_Games_reasoning_v6_sample3 train
Video_Games_reasoning_v6_sample4 train
Video_Games_reasoning_v6_sample5 train

子集特性

  • 共享相同提示词版本的子集(如 Video_Games_reasoning 及其 sample2、sample3;Video_Games_reasoning_v6 及其 sample2 至 sample5)均为对同一 49,133 行数据在不同 temperature=1 条件下的独立采样。
  • 子集之间不重复推理文本,可通过 _source_index 列进行行级对齐。
  • 适用于多数投票、难度分层或数据增强等场景。

提示词版本说明

子集的生成模板位于 prompts/ 目录下,每个 prompt_v<N>.txt 对应生成 *_reasoning_v<N> 子集:

提示词文件 对应的子集
prompts/prompt_v4.txt Video_Games_reasoning_v4
prompts/prompt_v5.txt Video_Games_reasoning_v5
prompts/prompt_v6.txt Video_Games_reasoning_v6Video_Games_reasoning_v6_sample2Video_Games_reasoning_v6_sample3Video_Games_reasoning_v6_sample4Video_Games_reasoning_v6_sample5

提示词输出格式

所有提示词均输出包含 predictabilitytransition_typereasoning 字段的严格 JSON:

  • v4:要求 4-8 句分析师独白(证据 → 兴趣 → 机制 → 预测)。
  • v5:收紧为 1-6 句基于证据的推理,禁止复述完整历史。
  • v6:回归 4-8 句分析师独白(120-180 词),并额外提供物品描述,使每个语义 ID 通过具体属性表征而不提及标题。

模型检查点

数据集中包含已训练模型,存放于 checkpoints/<experiment>/<step>/,格式为 HuggingFace 模型可直接加载:

实验名称 阶段 检查点
Video_Games_stage2_cot_v4_gpt54_Qwen3-1.7B Stage-2 CoT final_checkpoint
Video_Games_stage2_cot_v5_gpt54_Qwen3-1.7B Stage-2 CoT final_checkpoint
Video_Games_stage2_cot_v6_single_Qwen3-1.7B Stage-2 CoT final_checkpoint
Video_Games_stage2_transition_cot_v6_Qwen3-1.7B Stage-2 CoT final_checkpoint
Video_Games_stage3_rl_no_kl_cot_v4_gpt54_Qwen3-1.7B Stage-3 RL global_step_200
Video_Games_stage3_rl_no_kl_cot_v5_gpt54_Qwen3-1.7B Stage-3 RL global_step_100

Stage-3 条目为 GRPO 检查点,基于对应的 Stage-2 CoT 模型初始化,并从分片 FSDP 形式合并生成。

使用方式

加载数据集

python from datasets import load_dataset

ds = load_dataset("mengdanzhu/genrec-dataset", "Video_Games_reasoning_v6_sample5", split="train")

加载模型检查点

python from huggingface_hub import snapshot_download from transformers import AutoModelForCausalLM, AutoTokenizer

sub = "checkpoints/Video_Games_stage3_rl_no_kl_cot_v5_gpt54_Qwen3-1.7B/global_step_100" path = snapshot_download("mengdanzhu/genrec-dataset", repo_type="dataset", allow_patterns=[sub + "/*"]) + "/" + sub model = AutoModelForCausalLM.from_pretrained(path) tokenizer = AutoTokenizer.from_pretrained(path)

搜集汇总
数据集介绍
genrec-dataset 数据集图片
构建方式
本数据集为SIDReasoner框架第二阶段推理数据,基于Video_Games领域49,133条原始记录构建。其核心构建方式是通过Azure OpenAI GPT-5.4生成链式思维(chain-of-thought)轨迹,替换上游推理路径,并将结果以严格JSON格式(包含predictability、transition_type和reasoning字段)存储。数据集包含多个配置子集,分别对应不同提示模板版本(v4、v5、v6),每个版本下又抽取独立样本(如sample2至sample5),所有子集通过_source_index字段与原始数据行对齐,确保样本间无推理文本重复。生成提示模板存放于prompts/目录,用于复现或扩展数据。
特点
该数据集在结构上呈现高度灵活性与多样性。同一提示版本下,多个独立样本子集(如Video_Games_reasoning与对应sample2/3)为相同原始行的不同推理轨迹,可用于多数投票、难度分层或数据增强,且文本互不重叠。提示版本演进带来风格差异:v4强调分析师独白(证据-兴趣-机制-预测),v5则要求简洁证据支撑且禁止复述完整历史,v6回归详细独白并融入物品描述,使语义ID通过具体属性表征而不暴露标题。此外,数据集附带训练好的模型检查点(Stage-2 CoT与Stage-3 RL),以HuggingFace格式存储,便于直接加载。
使用方法
使用该数据集时,可通过HuggingFace datasets库加载指定配置,例如load_dataset('mengdanzhu/genrec-dataset', 'Video_Games_reasoning_v6_sample5', split='train')。训练管道可通过设置环境变量SIDR_HF_REPO指向此仓库。对于需要推理数据增强或多数投票的研究,可选取同版本下的多个样本子集。对于模型部署,可下载checkpoints目录下的预训练模型,利用snapshot_download和AutoModelForCausalLM加载,实现即用型推理能力。数据集的prompts/目录提供了生成提示模板,支持按需再生成或扩展数据。
背景与挑战
背景概述
genrec-dataset是由研究者Mengdan Zhu等人构建的专用数据集,旨在服务于SIDReasoner系统的第二阶段推理训练。该数据集于近期发布在HuggingFace平台上,其核心研究问题聚焦于如何利用大语言模型(如Azure OpenAI GPT-5.4)生成的思维链(chain-of-thought)轨迹,增强模型对视频游戏推荐场景中用户行为序列的因果推断与预测能力。通过引入多样化的提示模板(v4至v6),数据集细粒度地模拟了分析师式推理、证据支撑的简洁推理以及融合物品属性的深度推理,为生成式推荐系统的推理能力训练提供了高质量语料。该数据集设计了多个独立采样子集,支持多数投票、难度分层及数据增强等进阶用法,并附带训练好的模型检查点(包括阶段2的思维链模型与阶段3的强化学习微调模型),对推荐系统领域的大模型推理技术研究具有推动意义。
当前挑战
该数据集主要应对生成式推荐系统中推理能力薄弱的挑战,传统推荐模型多依赖浅层模式匹配,难以解释用户行为背后的动态兴趣迁移及因果逻辑,而genrec-dataset通过结构化的推理路径(包含可预测性、转换类型与推理文本)为模型提供了可学习的因果链条,填补了该领域的语料空缺。在构建过程中,数据集面临多重挑战:确保不同提示版本下生成的推理文本在语义上一致且无重复,需严格控制采样过程;平衡推理的深度与简洁性,例如v5版本限制为1-6句且禁止复述历史,而v6版本需在120-180字内融合物品描述而不泄露标题;同时,跨子集的对齐(通过_source_index)要求严格的索引管理,以支持多数投票等操作;此外,生成大批量独立的思维链数据(每子集49,133行)需消耗大量计算资源,并需校验GPT-5.4输出的JSON格式与逻辑合理性,以保证数据质量。
常用场景
经典使用场景
genrec-dataset作为面向推荐系统推理能力增强的专用数据集,其核心应用场景聚焦于为基于大语言模型的推荐器提供高质量思维链训练语料。该数据集以视频游戏领域为用户交互背景,通过结构化字段(如predictability、transition_type与reasoning)组织数据,支持监督微调。研究者可借助其多版本配置(如Video_Games_reasoning_v4至v6及不同采样子集)训练模型学习从用户历史行为到推荐预测的因果推断,亦可用于评估模型在解释生成、偏好理解及语义ID表征方面的性能,是构建可解释、具备推理能力的下一代推荐系统的基石资源。
衍生相关工作
围绕该数据集已衍生出一系列具有代表性的后续研究。基于其多采样子集和相同提示词版本的不同样本,研究者开展了多数投票(majority voting)策略以提升推理稳定性,亦利用其行级对齐特性进行难度分层(difficulty stratification)以优化课程学习。数据集中的思维链轨迹被用作奖励模型或批评模型的训练信号,涌现出如‘推理偏好优化’(RPO)与‘可解释性强化学习’等方向的工作。其随附的检查点(如Stage-2 CoT与Stage-3 GRPO)支持了从监督微调到强化学习对齐的完整训练流程复现,促进了推荐系统领域内关于推理一致性、上下文利用效率及零样本迁移等话题的深入探索。
数据集最近研究
最新研究方向
genrec-dataset作为面向推荐系统推理增强的前沿数据集,其最新研究方向聚焦于利用大规模链式思维(Chain-of-Thought)标注数据来提升序列推荐模型的解释性推理能力。该数据集通过引入多版本提示模板(如v4至v6),生成包含可预测性、转换类型及详细推理路径的高质量数据,并支持多样本独立采样,为多数投票、难度分层及数据增强等研究提供坚实基础。同时,数据集配套的GRPO强化学习检查点展示了从监督微调到强化对齐的进阶训练范式,这对于推动推荐系统从单纯性能优化向可解释、可推理的智能决策演进具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务