基于深度学习的个性化用户告推荐模型数据集合
收藏官方服务:
资源简介:
本数据集采用分布式文件系统按日期分区存储,以JSON格式组织,每日增量约2GB,支持Spark等大数据框架并行读取与分布式训练。数据涵盖用户画像特征、广告交互行为及推荐模型训练三类结构化对象。 一、用户特征数据包含匿名化用户ID、年龄段、性别、地域编码、兴趣标签向量、活跃度评分及设备信息。用户ID经SHA-256哈希处理,不涉及个人可识别信息。兴趣标签向量基于历史点击行为生成多维权重,活跃度评分综合近30天登录频次、浏览时长与交互深度。 二、广告交互行为数据包含交互唯一标识、用户ID、广告ID、广告位类型(开屏/信息流/横幅/插屏)、交互类型(曝光/点击/转化/深度转化)、交互时间戳、交互上下文(页面来源、 session ID)及转化价值。广告位类型覆盖开屏、信息流、横幅、插屏,交互类型涵盖曝光、点击、转化与深度转化。对广告ID与用户ID建立联合索引以提升序列建模检索效率,交互时间戳精确到毫秒级,支撑用户行为时序分析。 三、推荐模型训练数据包含训练样本唯一标识、用户特征向量(经Embedding层编码后的稠密向量)、广告特征向量、历史行为序列、样本标签、样本权重及数据集分割标识。
提供机构:
上海思游网络科技有限公司创建时间:
2026-09-03
搜集汇总
数据集介绍

背景与挑战
背景概述
该数据集是按日期分区、以JSON格式存储的分布式数据集,每日增量约2GB,支持Spark等框架进行并行读取与分布式训练。数据涵盖用户特征、广告交互行为和推荐模型训练三类结构化信息,其中用户特征经匿名化处理以保护隐私,广告交互数据则记录了展示、点击及转化等多种类型及其上下文,为个性化广告推荐模型的构建和训练提供了基础支持。
以上内容由遇见数据集搜集并总结生成



