RecIF-Bench
收藏资源简介:
RecIF-Bench是第一个全面的推荐指令跟随基准,包含来自20万用户在多个异构领域(短视频、广告、产品)的1亿次交互数据。该基准将8个不同的任务组织成一个四层能力层次,用于严格评估指令跟随和领域特定推荐之间的协同作用。
RecIF-Bench is the first comprehensive recommendation instruction-following benchmark, which contains 100 million interaction records from 200,000 users across multiple heterogeneous domains including short videos, advertisements, and products. This benchmark organizes eight distinct tasks into a four-layer capability hierarchy to rigorously evaluate the synergies between instruction following and domain-specific recommendation.
OpenOneRec 数据集概述
数据集基本信息
- 数据集名称: OpenOneRec
- 核心组成部分: 包含一个名为 RecIF-Bench 的推荐指令遵循基准数据集,以及一系列名为 OneRec-Foundation 的基础模型。
- 核心目标: 旨在弥合传统推荐系统与大型语言模型(LLMs)之间的差距,加速生成式推荐研究。
RecIF-Bench 基准数据集详情
- 数据规模: 包含来自20万用户的 1亿次交互。
- 数据领域: 聚合了三个异构领域的数据:短视频(内容)、广告(商业) 和 产品(电子商务)。
- 任务设计: 包含8个不同的任务,组织为一个四层能力层次结构:
- 层0:语义对齐(项目理解)
- 层1:基础预测(短视频推荐、广告推荐、产品推荐、标签预测)
- 层2:指令遵循(交互式推荐、标签条件推荐)
- 层3:推理(推荐解释)
OneRec-Foundation 模型系列
- 模型基础: 基于 Qwen3 架构构建,并引入了 Itemic Tokens 用于模态对齐。
- 模型版本:
- 标准版: 在开源数据(约330亿令牌)上训练。
- OneRec-1.7B (https://huggingface.co/OpenOneRec/OneRec-1.7B)
- OneRec-8B (https://huggingface.co/OpenOneRec/OneRec-8B)
- 专业版 (Pro): 在标准版基础上,额外使用了来自快手的千亿令牌工业语料库进行增强(总计约1300亿令牌)。
- OneRec-1.7B-Pro (https://huggingface.co/OpenOneRec/OneRec-1.7B-pro)
- OneRec-8B-Pro (https://huggingface.co/OpenOneRec/OneRec-8B-pro)
- 标准版: 在开源数据(约330亿令牌)上训练。
性能表现
RecIF-Bench 基准测试结果
OneRec-Foundation 模型在 RecIF-Bench 的各项任务上取得了 最先进(SOTA) 的结果,显著优于 SASRec、TIGER、LC-Rec 等基线模型。其中 OneRec-8B-Pro 模型在大多数任务上表现最佳。
跨领域可迁移性
在 Amazon Benchmark(包含10个数据集)上,OpenOneRec 展示了卓越的零样本/少样本迁移能力,在 Recall@10 指标上平均比第二名方法提升了 26.8%。
方法架构与训练流程
- 核心方法: 将推荐重新定义为通用的序列建模范式,使用 Itemic Tokens 将物品视为一种独立的模态。
- 训练流程:
- 预训练: 通过 Itemic-Text 对齐和全参数协同预训练整合协同信号。
- 后训练:
- 阶段1:多任务监督微调,用于基础指令遵循。
- 阶段2:策略蒸馏,以恢复通用推理性能。
- 阶段3:强化学习,以增强推荐能力。
许可证
- 代码库遵循 Apache 2.0 许可证。
- 模型权重遵循其特定的许可证协议。




